OpenAI 3 сентября представила GPT-6 Astra — новую систему, для которой компания заявила 97,6% правильных ответов в наборе задач FrontierMath Tier 4 (v2) и 99,9% в тесте ARC-AGI-3 в отдельной конфигурации Provider Adapter. Результаты свидетельствуют о резком прогрессе в решении сложных формализованных задач, однако их не следует автоматически трактовать как доказательство универсального превосходства над людьми в математике или творческом мышлении.
Наиболее заметный показатель Astra — 97,6% на FrontierMath Tier 4 (v2), самом сложном уровне бенчмарка, состоящем из 50 задач. По данным Epoch AI, этот набор завершили в июне 2025 года; он создан для проверки работы с математическими задачами исследовательского уровня. В то же время результат описывает производительность системы именно на ограниченном наборе заданий, а не на всей современной передовой математике.
Сравнение с людьми имеет важные ограничения
Авторы FrontierMath проводили отдельное тестирование с участием примерно 40 студентов MIT, которых распределили на восемь команд по четыре-пять человек. За 4,5 часа и с доступом к интернету команды решали 23 задачи уровней 1–3: средний результат одной команды составил 19%, а все команды вместе закрыли 35% заданий.
Это сравнение не охватывало Tier 4 и не было индивидуальным соревнованием с профессиональными математиками. Поэтому из него не следует утверждение, что Astra превзошла любого живого специалиста во всех направлениях математической работы. Вместо этого оно показывает, насколько далеко система продвинулась в конкретном стандартизированном тесте.
Другой рекордный показатель OpenAI привела для ARC-AGI-3 — бенчмарка с новыми визуальными головоломками, где важны не только правильные ответы, но и количество действий. По данным ARC Prize, результат GPT-6 Astra зависит от режима запуска: в Standard harness он составляет 62,7%, тогда как в Provider Adapter — 99,9%. Последняя конфигурация сохраняет внутреннее состояние рассуждений между запросами и использует compaction, поэтому эти цифры не являются прямо взаимозаменяемыми оценками.
OpenAI также заявила, что Astra превысила человеческий базовый уровень по эффективности действий на 96% уровней ARC-AGI-3. ARC Prize характеризует этот результат как близкий к человеческому паритету, а не как окончательно доказанное сверхчеловеческое превосходство. Такая разница в формулировках важна: высокий балл на бенчмарке подтверждает способность системы работать с его правилами, но не измеряет все виды человеческого интеллекта или профессиональной экспертизы.
Доступ и практическое применение
OpenAI сообщила о поэтапном развертывании GPT-6 Astra через ChatGPT, API, Azure и AWS Bedrock. Подписка ChatGPT Plus стоимостью 20 долларов в месяц не означает неограниченного доступа ко всем функциям: для ее пользователей Astra доступна в Work и Codex и действует в пределах установленных лимитов. GPT-6 Pro в обычном Chat, по информации OpenAI, предназначена для тарифов Pro, Business и Enterprise.
Практическое значение таких результатов может заключаться в более быстрой проверке сложных расчетов, поиске формальных закономерностей, разработке программного обеспечения и работе с задачами, где нужно последовательно выводить решение. Однако заявленные бенчмарки сами по себе не отвечают на вопрос о надежности системы в финансовых, научных или управленческих решениях: для таких сфер критически важными остаются проверка выводов, качество данных и ответственность людей, применяющих инструмент.








