Лучшая модель Claude для кода и текста: сравнение бенчмарков
Claude и Qwen спорят: safety-фильтры уравнивают Fable 5 с Opus 4.8
В статье reAPI сравниваются модели Claude для программирования и текстовых задач. По данным Anthropic, Claude Fable 5 лидирует в SWE-Bench Pro с 80,3%, но Opus 5 выигрывает более новый агентный терминальный бенчмарк и стоит значительно дешевле: 2,40 доллара за миллион входных токенов против 8,00 у Fable 5. На DeepSWE v1.1 GPT-5.6 Sol получает 72,7% против 68,8% у Opus 5. Для текста Opus 5 опережает Fable 5 в GDPval-AA v2. Вывод: лучшая модель зависит от задачи, а настройка уровня усилий часто важнее смены модели.
Вопрос, какая модель Claude лучше всего подходит для программирования, не имеет одного ответа. Если смотреть только на максимальные значения бенчмарков, на лучшее соотношение цены и результата или на стабильность в неожиданных ситуациях, можно прийти к трём разным моделям. В материале reAPI на основе опубликованных Anthropic данных сравниваются Claude Fable 5, Claude Opus 5 и Claude Opus 4.8, а также упоминается GPT-5.6 Sol. Для агентного программирования Fable 5 показывает 80,3% на SWE-Bench Pro, это самый высокий показатель среди прямо сравнимых строк. Однако в более новом агентном терминальном бенчмарке Opus 5 выигрывает уверенно: на Frontier-Bench v0.1 у него 43,3% против 33,7% у Fable 5 и 21,1% у Opus 4.8. В Anthropic отметили, что публичная версия Fable 5 может отклоняться от нес ограниченной из-за срабатывания safety-классификаторов, поэтому реально доступная модель по Terminal-Bench может оказаться ближе к Opus 4.8. На DeepSWE v1.1 таблица Anthropic показывает GPT-5.6 Sol с 72,7% против 68,8% у Opus 5. Это примечательно, потому что DeepSWE относится к агентному программированию, под которое Opus 5 и позиционируется. Но если рабочая нагрузка больше похожа на длинную терминальную работу, Opus 5 в той же таблице обходит конкурента на девять пунктов. Урок не в том, что одна модель объективно лучше другой, а в том, что выбор зависит от того, какой бенчмарк точнее отражает вашу задачу. Для текстовых задач порядок меняется. Opus 5 набирает 1861 Elo в GDPval-AA v2, Fable 5 — 1747, Opus 4.8 — 1593. Разрыв составляет 114 Elo в пользу Opus 5. На Humanity's Last Exam без инструментов Fable 5 и Opus 5 показывают 56,5% и 56,3%, то есть статистически равны; с инструментами у Opus 5 64,7%, у Fable 5 63,9%. Для черновиков, редактирования и синтеза текста это сигнал в пользу Opus 5, а не модели, которая лидирует в кодовых бенчмарках. Отдельно подчёркивается, что уровень усилий (effort level) может влиять на результат сильнее, чем смена модели. Anthropic описывает Opus 5 как модель, которая лучше предыдущих Opus превращает дополнительные усилия в более качественные ответы, и отмечает, что режимы low и medium дают сильное качество при меньшем количестве токенов и задержке. Рекомендуется начинать со стандартного high и проверять обе стороны на собственных оценках. Это практический вывод: команда, которая выбрала условно лучшую модель, но оставила effort по умолчанию, может получить худший результат, чем команда с моделью уровнем ниже, но с настроенным effort. На платформе reAPI цены за миллион токенов: Fable 5 — 8 долларов за вход и 40 за выход; Opus 5 — 2,40 и 12; Opus 4.8 — 4 и 20; Sonnet 4.6 — 2,40 и 12. Fable 5 дороже Opus 5 более чем в три раза. К этому добавляется обязательное 30-дневное хранение и слой отказов у Fable 5. Для большинства команд такая переплата не очевидна, но для миграции репозитория, где неудачный прогон обходится дороже токенов, может быть оправдана. Итоговые рекомендации из статьи: по умолчанию выбирать Opus 5, потому что у него лучший балл в знаниевой работе, уверенная победа в новом агентном терминальном бенчмарке и самая низкая цена среди трёх моделей. Fable 5 стоит брать, когда задача длинная и сложная и вы сами измерили его преимущество. Opus 4.8 оставить, если ваши оценки уже откалиброваны под него или нужно отключить режим размышлений на высоких уровнях усилий, чего Opus 5 не позволяет. Если рабочая нагрузка похожа на DeepSWE, стоит рассмотреть модель не из семейства Claude — об этом говорит таблица самого Anthropic. В примере кода переключение между моделями сводится к замене строки model в запросе к API, например claude-opus-5, при этом ключ и базовый URL остаются теми же.