OpenAI 3 вересня представила GPT-6 Astra — нову систему, для якої компанія заявила 97,6% правильних відповідей у наборі задач FrontierMath Tier 4 (v2) та 99,9% у тесті ARC-AGI-3 в окремій конфігурації Provider Adapter. Результати свідчать про різкий прогрес у розв’язанні складних формалізованих задач, однак їх не варто автоматично трактувати як доказ універсальної переваги над людьми в математиці чи творчому мисленні.
Найбільш помітний показник Astra — 97,6% на FrontierMath Tier 4 (v2), найскладнішому рівні бенчмарку, який складається з 50 задач. За даними Epoch AI, цей набір завершили у червні 2025 року; він створений для перевірки роботи з математичними задачами дослідницького рівня. Водночас результат описує продуктивність системи саме на обмеженому наборі завдань, а не на всій сучасній передовій математиці.
Людське порівняння має важливі обмеження
Автори FrontierMath проводили окреме тестування за участю приблизно 40 студентів MIT, яких розподілили на вісім команд по чотири-п’ять осіб. За 4,5 години та з доступом до інтернету команди розв’язували 23 задачі рівнів 1–3: середній результат однієї команди становив 19%, а всі команди разом закрили 35% завдань.
Це порівняння не охоплювало Tier 4 і не було індивідуальним змаганням із професійними математиками. Тому з нього не випливає твердження, що Astra перевершила будь-якого живого фахівця в усіх напрямах математичної роботи. Натомість воно показує, наскільки далеко система просунулася в конкретному стандартизованому тесті.
Інший рекордний показник OpenAI навела для ARC-AGI-3 — бенчмарку з новими візуальними головоломками, де важливі не лише правильні відповіді, а й кількість дій. За даними ARC Prize, результат GPT-6 Astra залежить від режиму запуску: у Standard harness він становить 62,7%, тоді як у Provider Adapter — 99,9%. Остання конфігурація зберігає внутрішній стан міркувань між запитами та використовує compaction, тому ці цифри не є прямими взаємозамінними оцінками.
OpenAI також заявила, що Astra перевищила людський базовий рівень за ефективністю дій на 96% рівнів ARC-AGI-3. ARC Prize характеризує цей результат як близький до людського паритету, а не як остаточно доведену надлюдську перевагу. Така різниця у формулюваннях важлива: високий бал на бенчмарку підтверджує здатність системи працювати з його правилами, але не вимірює всі види людського інтелекту чи професійної експертизи.
Доступ і практичне застосування
OpenAI повідомила про поетапне розгортання GPT-6 Astra через ChatGPT, API, Azure та AWS Bedrock. Підписка ChatGPT Plus вартістю 20 доларів на місяць не означає необмеженого доступу до всіх функцій: для її користувачів Astra доступна в Work і Codex та діє в межах встановлених лімітів. GPT-6 Pro у звичайному Chat, за інформацією OpenAI, призначена для тарифів Pro, Business і Enterprise.
Практичне значення таких результатів може полягати у швидшій перевірці складних розрахунків, пошуку формальних закономірностей, розробці програмного забезпечення та роботі з задачами, де потрібно послідовно виводити рішення. Проте заявлені бенчмарки не відповідають самі по собі на питання про надійність системи у фінансових, наукових чи управлінських рішеннях: для таких сфер критичними залишаються перевірка висновків, якість даних і відповідальність людей, які застосовують інструмент.






