Неділя, 13 Вересня, 2026
16 C
Kyiv

OpenAI GPT-6 Astra набрала 97,6% у тесті FrontierMath Tier 4

OpenAI 3 вересня представила GPT-6 Astra — нову систему, для якої компанія заявила 97,6% правильних відповідей у наборі задач FrontierMath Tier 4 (v2) та 99,9% у тесті ARC-AGI-3 в окремій конфігурації Provider Adapter. Результати свідчать про різкий прогрес у розв’язанні складних формалізованих задач, однак їх не варто автоматично трактувати як доказ універсальної переваги над людьми в математиці чи творчому мисленні.

Найбільш помітний показник Astra — 97,6% на FrontierMath Tier 4 (v2), найскладнішому рівні бенчмарку, який складається з 50 задач. За даними Epoch AI, цей набір завершили у червні 2025 року; він створений для перевірки роботи з математичними задачами дослідницького рівня. Водночас результат описує продуктивність системи саме на обмеженому наборі завдань, а не на всій сучасній передовій математиці.

Людське порівняння має важливі обмеження

Автори FrontierMath проводили окреме тестування за участю приблизно 40 студентів MIT, яких розподілили на вісім команд по чотири-п’ять осіб. За 4,5 години та з доступом до інтернету команди розв’язували 23 задачі рівнів 1–3: середній результат однієї команди становив 19%, а всі команди разом закрили 35% завдань.

Це порівняння не охоплювало Tier 4 і не було індивідуальним змаганням із професійними математиками. Тому з нього не випливає твердження, що Astra перевершила будь-якого живого фахівця в усіх напрямах математичної роботи. Натомість воно показує, наскільки далеко система просунулася в конкретному стандартизованому тесті.

Інший рекордний показник OpenAI навела для ARC-AGI-3 — бенчмарку з новими візуальними головоломками, де важливі не лише правильні відповіді, а й кількість дій. За даними ARC Prize, результат GPT-6 Astra залежить від режиму запуску: у Standard harness він становить 62,7%, тоді як у Provider Adapter — 99,9%. Остання конфігурація зберігає внутрішній стан міркувань між запитами та використовує compaction, тому ці цифри не є прямими взаємозамінними оцінками.

OpenAI також заявила, що Astra перевищила людський базовий рівень за ефективністю дій на 96% рівнів ARC-AGI-3. ARC Prize характеризує цей результат як близький до людського паритету, а не як остаточно доведену надлюдську перевагу. Така різниця у формулюваннях важлива: високий бал на бенчмарку підтверджує здатність системи працювати з його правилами, але не вимірює всі види людського інтелекту чи професійної експертизи.

Доступ і практичне застосування

OpenAI повідомила про поетапне розгортання GPT-6 Astra через ChatGPT, API, Azure та AWS Bedrock. Підписка ChatGPT Plus вартістю 20 доларів на місяць не означає необмеженого доступу до всіх функцій: для її користувачів Astra доступна в Work і Codex та діє в межах встановлених лімітів. GPT-6 Pro у звичайному Chat, за інформацією OpenAI, призначена для тарифів Pro, Business і Enterprise.

Практичне значення таких результатів може полягати у швидшій перевірці складних розрахунків, пошуку формальних закономірностей, розробці програмного забезпечення та роботі з задачами, де потрібно послідовно виводити рішення. Проте заявлені бенчмарки не відповідають самі по собі на питання про надійність системи у фінансових, наукових чи управлінських рішеннях: для таких сфер критичними залишаються перевірка висновків, якість даних і відповідальність людей, які застосовують інструмент.

Популярне цього тижня

Трамп закликав Зеленського припинити удари по дизельній інфраструктурі Росії

Президент США Дональд Трамп 13 вересня закликав Володимира Зеленського припинити удари по російських об’єктах, пов’язаних із дизельним пальним.

WP: в Остраві поляка побили, прийнявши за українця через жовто-синій капелюх

Польське видання WP повідомило про напад у чеській Остраві на велосипедиста з Польщі, якого, за його словами, агресори назвали «українцем» і «бандерівцем» через жовто-синій головний убір із написом «Верхня Сілезія».

Віталій Шабунін заявив про корумпованість і кримінальність нинішніх еліт

Лише кримінальними провадженнями подолати корупцію в Україні неможливо: паралельно з роботою правоохоронних органів потрібна зміна правил та інституцій, заявив у відеоінтерв’ю LIGA.net голова правління Центру протидії корупції Віталій Шабунін.

СБУ та прокуратура проводять понад 250 обшуків у справі про фальсифікований Biopatid

Служба безпеки України та Дніпропетровська обласна прокуратура 12 вересня проводять понад 250 санкціонованих обшуків у різних регіонах у справі про незаконне виготовлення та збут фальсифікованого препарату для схуднення Biopatid.

Дизайнер Lumos AI заявив, що ШІ здешевив розробку, а смак став перевагою стартапів

Засновницький дизайнер Lumos AI Яша Грозян у колонці для AIN описав, як почав самостійно створювати частину продуктового функціоналу за допомогою кодинг-агентів.

Теми

Трамп закликав Зеленського припинити удари по дизельній інфраструктурі Росії

Президент США Дональд Трамп 13 вересня закликав Володимира Зеленського припинити удари по російських об’єктах, пов’язаних із дизельним пальним.

WP: в Остраві поляка побили, прийнявши за українця через жовто-синій капелюх

Польське видання WP повідомило про напад у чеській Остраві на велосипедиста з Польщі, якого, за його словами, агресори назвали «українцем» і «бандерівцем» через жовто-синій головний убір із написом «Верхня Сілезія».

Віталій Шабунін заявив про корумпованість і кримінальність нинішніх еліт

Лише кримінальними провадженнями подолати корупцію в Україні неможливо: паралельно з роботою правоохоронних органів потрібна зміна правил та інституцій, заявив у відеоінтерв’ю LIGA.net голова правління Центру протидії корупції Віталій Шабунін.

СБУ та прокуратура проводять понад 250 обшуків у справі про фальсифікований Biopatid

Служба безпеки України та Дніпропетровська обласна прокуратура 12 вересня проводять понад 250 санкціонованих обшуків у різних регіонах у справі про незаконне виготовлення та збут фальсифікованого препарату для схуднення Biopatid.

Дизайнер Lumos AI заявив, що ШІ здешевив розробку, а смак став перевагою стартапів

Засновницький дизайнер Lumos AI Яша Грозян у колонці для AIN описав, як почав самостійно створювати частину продуктового функціоналу за допомогою кодинг-агентів.

PISA-2025: майже половина українських підлітків не досягає базового рівня з математики та читання

Майже половина українських 15-річних підлітків не досягає базового рівня з математики та читання: 46% мають результати нижче базового з математики, а 45% — із читання.

Відновлення енергетики України протягом десяти років потребує 91 млрд доларів

Потреби України у відновленні та реконструкції енергетичного сектору в найближчі десять років оцінюються приблизно у $91 млрд.

Моді зустрівся з Путіним у Нью-Делі та закликав до діалогу і дипломатії

Прем’єр-міністр Індії Нарендра Моді 11 вересня в Нью-Делі провів переговори з російським президентом Володимиром Путіним напередодні саміту БРІКС.

Схожі статті

Популярні категорії

«Можна створити навіть вундервафлю, але щойно зупинишся — твій продукт швидко застаріє»: інтерв’ю з керівним директором Helsing в Україні Андрієм Шевченком

Helsing призначила Андрія Шевченка керівним директором в Україні Німецька оборонна технологічна компанія Helsing 12 липня призначила Андрія Шевченка керівним директором в Україні. Це нова посада...

Apple стала другою у світі компанією із ринковою вартістю понад $5 трлн

Apple ненадовго перевищила $5 трлн капіталізації і стала другою у світі Apple стала другою компанією у світі, чия ринкова капіталізація під час біржових торгів перевищила...
мережа київстар

Київстар не планує масштабно запускати 5G в Україні до завершення війни

«Київстар» не розраховує на масштабне розгортання 5G в Україні до завершення війни, оскільки запуск мережі потребує перевірки її електромагнітної сумісності з військовими системами. Провести...
auron solutions

Pravo Ventures інвестував в українсько-американську Defense Tech-компанію Auron Solutions

Інвестиційно-аналітичний синдикат Pravo Ventures повідомив про вкладення в українсько-американську defense-tech компанію Auron Solutions, яка розробляє системи радіоелектронної боротьби з елементами штучного інтелекту для протидії...

NVIDIA створює нову команду з безпеки ШІ та посилює увагу до відкритих моделей

NVIDIA набирає команду для перевірки безпеки ШІ-агентів і відкритих моделей NVIDIA почала формувати нову команду з безпеки та захисту штучного інтелекту. Вона має перевіряти ШІ-агентів...