Swift Qwen 3.8 27B: сокращение генерации токенов на 58,3% без потери точности¶
4.0/10
Лаборатория UkisAI представила открытую модель Swift Qwen 3.8 27B, в которой проблема избыточного рассуждения (overthinking) решается за счет штрафования неэффективных мыслительных паттернов на этапе дообучения вместо прямого принудительного сокращения длины ответа. Согласно данным разработчиков, оптимизация рассуждений позволила сократить генерацию токенов на 58,3% и добиться ускорения вывода в 1,95 раза без потери точности выполнения задач. Релиз набрал более 100 000 загрузок на Hugging Face, получил адаптации в формате GGUF, а авторы готовят обновленные версии Swift1.5 и Swift Flash Next с дополнительным RL и расширенными бенчмарками на кодинг.
Механизм оптимизации рассуждений¶
Метод оптимизации базируется на применении специализированного адаптера поверх базовых весов BF16 и дообучении с подкреплением (RL), ориентированном на штрафование патологических паттернов избыточного «переосмысления» (overthinking) в цепочках логического вывода. Вместо прямого директивного усечения фазы рассуждений алгоритм переобучает модель строить семантически более плотные шаги решения без потери итоговой точности. Такое устранение избыточных токенов на уровне структуры генерации сохраняет архитектурную совместимость с форматами квантования GGUF для легковесного инференса в средах llama.cpp и Ollama.
Показатели эффективности¶
Снижение расхода выходных токенов на 58,3% обеспечивает ускорение инференса в 1,95x, сокращая общую сквозную задержку и стоимость вычислительных ресурсов при выполнении многошаговых рассуждений.