Alibaba представила открытую ИИ-модель Qwen 3.8 Max: 10 дней автономного программирования
Grok: Qwen 10 дней пилит код как джун; GPT: зато миллион токенов
Alibaba выпустила Qwen 3.8 Max — открытую нейросеть с 2,4 триллиона параметров, способную автономно программировать на протяжении десяти дней. Модель продемонстрировала свои возможности, создав с нуля полностью рабочий код-агент «O my CLI». Благодаря архитектуре Mixture-of-Experts и контекстному окну на миллион токенов она может долго удерживать проект в фокусе и самостоятельно исправлять ошибки. В тестах на агентные задачи модель обходит многих конкурентов, включая GPT‑5.6 и Claude Fable 5, а открытые веса и доступные цены на API делают передовую ИИ-разработку доступнее для программистов и независимых разработчиков.
Alibaba совершила значительный шаг в области агентного ИИ, выпустив модель Qwen 3.8 Max с открытыми весами. Это гигантская система на основе Mixture-of-Experts насчитывает 2,4 триллиона параметров, но активирует лишь около 95 миллиардов на токен, обеспечивая высокую эффективность. Модель поддерживает контекстное окно в миллион токенов и нативно обрабатывает изображения, видео и текст, что позволяет ей визуально оценивать результаты своей работы и корректировать действия. Самая впечатляющая демонстрация — полностью автономная разработка в течение десяти дней: получив пустую директорию, Qwen 3.8 Max самостоятельно спроектировала и написала «O my CLI», работающего код-агента, который уже выложен на GitHub. Это стало возможным благодаря её способности к длительному планированию, итеративному выполнению задач и самокоррекции без вмешательства человека. Для разработчиков такой подход означает принципиально новый уровень автоматизации: модель способна вести проекты от концепции до развёртывания, сохраняя целостность замысла на протяжении многих дней. Открытая публикация весов знаменует смену стратегии Alibaba — раньше столь мощные «Max»-версии не распространялись свободно. Параллельно компания позаботилась о доступности: полноразмерную модель можно использовать через API с тарифами 2 доллара за миллион входных токенов и 6 долларов за выходной миллион, а для локального запуска предложена облегчённая 27-миллиардная версия, работающая на обычных компьютерах. В эталонных тестах Qwen 3.8 Max демонстрирует конкурентоспособные результаты. На задачах агентного взаимодействия OSWorld-Verified она набрала 86,1 балла, обогнав Claude Fable 5 (85,0) и GPT‑5.6 Sol (83,2). В тесте на воспроизведение научных исследований PaperBench лидирует с 93,0 балла против 90,5 у GPT‑5.6 и 88,8 у Claude Fable 5. На Terminal-Bench 2.1 модель получила 86,6, превзойдя обе Claude Opus 4.8 и Claude Fable 5 (84,6), но уступив GPT‑5.6 Sol (88,8). В более сложном соревновании по программированию SWE-bench Pro результат составил 67,7 балла — здесь впереди оказались Claude Fable 5 (80,0) и Claude Opus 4.8 (69,2). Хотя демонстрация десятидневного программирования проходила в контролируемых условиях, практическая ценность очевидна: инженеры получают мощный инструмент для долгих автономных сессий разработки, ускоряющий создание прототипов и снижающий затраты на рутинное кодирование. Следует понимать, что «открытые веса» не тождественны open source — будущие лицензионные ограничения могут регулировать коммерческое применение. Тем не менее появление такой модели из Китая меняет глобальный баланс сил в ИИ, подрывая доминирование закрытых систем западных компаний и делая передовую агентную технологию доступной широкому кругу разработчиков.