OpenAI представила GPT-6 Astra: ставка на управление компьютером и эру AGI
Grok и GPT спорят: отказ от PoC-эксплойтов — фильтр или пустой звук AGI-эры
OpenAI выпустила флагманскую модель GPT-6 Astra, и Грег Брокман назвал это началом эры AGI. По официальным таблицам Astra лидирует в задачах управления компьютером и в научных расчётах, а в программировании лишь немного опережает или уступает моделям Claude. Подписчики Plus, Pro, Business и Enterprise получат доступ в течение нескольких дней, API стоит десять долларов за миллион входных токенов и пятьдесят за выходные. Автор, который сам делал инструменты автоматизации для macOS, замечает, что часть этой работы теперь закрывает сама модель.
OpenAI выпустила новую флагманскую модель GPT-6 Astra. Автор колонки пишет, что релиз состоялся 4 сентября, через два дня после выхода Claude Fable 5.1 от Anthropic. Сэм Альтман объяснил задержку требованиями по безопасности и согласованию, а Грег Брокман написал: Welcome to the AGI era. Запуск прошёл неровно: страницу с анонсом сначала нашли на сайте и сняли, официальная ссылка какое-то время не открывалась, а за несколько часов до релиза ChatGPT, Claude и Grok одновременно переживали сбой. Что получают пользователи. Astra подключат подписчикам Plus, Pro, Business и Enterprise в течение нескольких дней, расход идёт внутри существующей квоты, при нехватке можно докупать кредиты. В корпоративном тарифе модель по умолчанию выключена, включать её должен администратор. В API модель называется gpt-6-astra и доступна в Amazon Bedrock: 10 долларов за миллион входных токенов и 50 за выходные. У предыдущей Sol было 5 и 30, то есть вход подорожал вдвое. Режим Fast работает в 2,5 раза быстрее и стоит вдвое дороже. Замеры. В математике указано 97,6% на FrontierMath Tier 4 и улучшения в задачах о промежутках между простыми числами. На ARC-AGI-3 заявлено 99,9%, но автор предупреждает: результат получен на собственном harness OpenAI, а незадолго до этого NVIDIA с моделью Opus 5 и своим harness тоже довела публичный набор до 100%, так что вклад обвязки может быть больше, чем модели. В программировании отрыв скромнее: на Terminal-Bench 4.0 у Astra 57,9% против 55,8% у Fable 5.1 и 52,3% у Opus 5, но на FrontierCode и в индексе Coding Agent Index от Artificial Analysis модель уступает. Управление компьютером. Именно здесь, по мнению автора, произошёл главный сдвиг. На OSWorld 2.0 у Astra 72,6% и в среднем 40 минут на задачу против 75 минут у Sol. В демонстрациях модель рисует печатную плату в KiCad, работает в Excel, собирает дашборд в Power BI, строит дом в Blender и переносит его в Unreal Engine 5, проверяет фронтенд сайта и заводит найденные баги в Linear. Отдельно показан браузерный картинговый гейм, созданный одной подсказкой через функцию Sites. Для разработчика это значит, что рутина в программах без API перестаёт требовать самодельных решений. Наука и код. На Terminal-Bench Science у модели 64,6% против 52,6% у Fable 5.1, на BenchCAD 95,9%, на длинном контексте MRCR v2 — 96,3%. При этом в Humanity's Last Exam с инструментами Astra проигрывает: 57,2% против 65,0%. В Codex появилось экспериментальное новшество: модель может вести заметки между контекстными окнами и искать по старым, не сжимая всё в одну сводку, а также задавать уточняющие вопросы асинхронно, продолжая работу. Безопасность. Astra стала первой моделью OpenAI, которая задела критический порог кибербезопасности во внутренней системе оценки. Поэтому она отказывается писать proof-of-concept эксплойтов, хотя аудит кода и патчи ей доступны, а в API при срабатывании проверки задача останавливается. По отзывам, которые приводит автор, модель хорошо пишет тексты и очень сильна в управлении компьютером, но склонна усложнять решения.