04.09.2026

OpenAI представила GPT-6 Astra с рекордными результатами в тестах и заявкой на начало эпохи AGI

OpenAI представила GPT-6 Astra — новую флагманскую модель искусственного интеллекта, которая заметно превосходит GPT-5.6 Sol в ряде специализированных тестов. Президент компании Грег Брокман во время презентации заявил, что появление Astra можно рассматривать как начало эпохи искусственного общего интеллекта. При этом он признал, что понятие AGI остается размытым и предложил пользователям самостоятельно оценивать, соответствует ли новая модель этому определению.

GPT-6 Astra стала результатом крупнейшего обучающего запуска в истории OpenAI. Для предварительного обучения компания впервые задействовала более 100 тысяч графических ускорителей на инфраструктуре Stargate в Техасе. Еще одной особенностью стало активное участие предыдущих ИИ-моделей OpenAI в контроле и сопровождении процесса обучения нового поколения системы.

Одним из наиболее впечатляющих результатов Astra стал тест ARC-AGI-3, предназначенный для проверки способности ИИ разбираться в незнакомых интерактивных средах. OpenAI сообщила о результате 98,6%, тогда как GPT-5.6 Sol в аналогичном сравнении показывала лишь 7,8%. Однако на итог сильно влияет используемая агентная инфраструктура: Astra работала через специальную систему, сохраняющую рассуждения между этапами и управляющую длинным контекстом, поэтому результат отражает возможности не только самой модели.

На математическом тесте FrontierMath Tier 4 результат Astra достиг 97,6%. В BenchCAD, где модели необходимо восстанавливать трехмерные CAD-модели по изображениям, новая система набрала 95,9% против 83,3% у GPT-5.6 Sol. В научном Terminal-Bench Science Astra получила 64,6%, заметно опередив предыдущие результаты конкурирующих моделей в представленных OpenAI сравнениях.

При этом в программировании однозначного лидерства добиться не удалось. В агентном тесте DeepSWE v1.1 GPT-6 Astra набрала 74,1% против 70,8% у GPT-5.6 Sol. Однако Meta ранее сообщала о результате 75,4% для Muse Spark 1.3 при максимальном уровне рассуждений, а Gemini 3.8 Flash и Claude Opus 5 также находятся примерно на уровне 74%. Разница между лучшими результатами настолько невелика, что говорить о безусловном превосходстве Astra в программировании пока сложно.

Для разработчиков важным изменением стала улучшенная работа с очень длинными задачами в Codex. Раньше при заполнении контекстного окна система сжимала старую информацию в краткое резюме, из-за чего могла потерять детали о предыдущих ошибках, тестах или ранних требованиях пользователя. Astra умеет сохранять заметки между контекстными окнами и искать нужные сведения в старых сообщениях и результатах работы инструментов. Пока функция экспериментальная, но OpenAI планирует сделать ее стандартной.

Модель также получила более развитые возможности работы непосредственно с компьютером. OpenAI демонстрировала Astra в KiCad, Excel, Blender и Power BI, а также при заполнении веб-форм и тестировании сайтов. В OSWorld V2-Offline модель набрала 72,6% против 65,7% у GPT-5.6 Sol. Одновременно среднее время выполнения задания сократилось примерно с 75 до 40 минут.

Высокая производительность сопровождается заметным увеличением стоимости. В API один миллион входных токенов GPT-6 Astra стоит $10, а выходных — $50. Это в 2,5 раза выше действующей стоимости GPT-5.6 Sol, хотя соответствует тарифам Claude Fable 5.1. OpenAI утверждает, что сравнивать следует не цену отдельного токена, а стоимость полностью выполненной задачи, поскольку Astra во многих сценариях расходует меньше токенов и требует меньше повторных попыток.

Одновременно OpenAI признает новые сложности с контролем более мощной модели. Astra лучше соблюдает границы поставленной задачи и в одном из внутренних испытаний не пыталась выходить за разрешенную область действий. Однако анализ показал, что письменные рассуждения новой системы сложнее отслеживать, чем у GPT-5.6 Sol. Главный научный сотрудник OpenAI Якуб Пахоцкий подчеркнул, что рост интеллекта модели автоматически не означает улучшения ее управляемости.

Особое внимание уделяется кибербезопасности. GPT-6 Astra стала первой моделью OpenAI, достигшей критического уровня возможностей в этой области по внутренней классификации компании. В тестах она смогла создавать работающие эксплойты для защищенных браузеров и операционных систем, а также обнаружила две ранее неизвестные уязвимости. На ExploitGym результат вырос с 30,3% у GPT-5.6 Sol до 42,4%, а в ExploitBench Astra достигла 100%.

При этом обычная версия модели будет ограничивать часть наиболее чувствительных киберзадач, включая некоторые виды поиска и эксплуатации уязвимостей. Более широкий доступ к таким возможностям OpenAI предоставляет проверенным специалистам по защите через программу Daybreak Blue. Для разработчиков через API предусмотрена отдельная система безопасности, которая при обнаружении опасной киберзадачи может полностью остановить ее выполнение.

Первоначально GPT-6 Astra предоставляется ограниченному числу корпоративных клиентов. Затем OpenAI планирует открыть модель пользователям ChatGPT Plus, Pro, Business и Enterprise, а также добавить ее в API и облачную инфраструктуру AWS. Для подписчиков Pro, Business и Enterprise будет доступна более мощная версия GPT-6 Astra Pro.

Несмотря на впечатляющие результаты, запуск Astra показывает, что вопрос о достижении AGI пока остается открытым. Новая модель демонстрирует серьезный прогресс в научных задачах, работе с компьютером, кибербезопасности и автономном выполнении сложных процессов, но в программировании не получила безоговорочного преимущества над конкурентами. Одновременно рост возможностей сопровождается повышенной стоимостью и новыми проблемами контроля, поэтому заявление OpenAI о начале «эпохи AGI» пока скорее отражает позицию самой компании, чем общепринятый вывод отрасли.

Добавить комментарий