BTC $79,654.52 +0.33%
ETH $2,458.73 +0.43%
BNB $765.02 +6.89%
XRP $1.41 -0.11%
SOL $102.83 +1.12%
TRX $0.3331 +1.12%
DOGE $0.0873 +2.53%
ADA $0.2154 +0.55%
BCH $250.14 -0.62%
LINK $11.86 +1.96%
HYPE $85.40 +0.06%
AAVE $129.97 -0.86%
SUI $0.7949 +5.37%
XLM $0.1834 +1.57%
ZEC $1,015.34 +2.74%
BTC $79,654.52 +0.33%
ETH $2,458.73 +0.43%
BNB $765.02 +6.89%
XRP $1.41 -0.11%
SOL $102.83 +1.12%
TRX $0.3331 +1.12%
DOGE $0.0873 +2.53%
ADA $0.2154 +0.55%
BCH $250.14 -0.62%
LINK $11.86 +1.96%
HYPE $85.40 +0.06%
AAVE $129.97 -0.86%
SUI $0.7949 +5.37%
XLM $0.1834 +1.57%
ZEC $1,015.34 +2.74%

“Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Ключевые тезисы
Summary: OpenAI выпустила GPT-6 Astra: "модель использования компьютера", которая может напрямую управлять компьютером и выполнять полные задачи.
Tencent Technology
2026-09-04 08:50:31
OpenAI выпустила GPT-6 Astra: "модель использования компьютера", которая может напрямую управлять компьютером и выполнять полные задачи.

文|晓静,腾讯科技

"Добро пожаловать в эпоху AGI."

Соучредитель и президент OpenAI Грег Брокман завершил презентацию GPT-6 Astra этой фразой.

3 сентября по местному времени в США OpenAI официально представила GPT-6 Astra. В отличие от предыдущих моделей, которые в основном отвечали на вопросы, генерировали и вызывали инструменты, Astra делает шаг вперед, начиная выполнять полные задачи, от получения инструкций и работы с программным обеспечением до корректировки следующих действий на основе результатов. Это также одна из причин, по которой OpenAI вновь упоминает "эпоху AGI".

OpenAI позиционирует Astra как "самую мощную модель использования компьютера в мире". Эта способность уже расширилась от простых задач, таких как работа с браузером, электронной почтой и таблицами, до профессионального программного обеспечения, такого как Power BI, KiCad, FreeCAD, и начала охватывать более сложные рабочие процессы, такие как анализ данных, проектирование, тестирование программного обеспечения и устранение неполадок.

В демонстрационном видео OpenAI Astra может начать с простого графика и продолжить выполнять задачи, такие как создание 3D-игр и страниц товаров. OpenAI также привела примеры проектирования печатных плат, моделирования в Blender, юридических документов, Excel и научного анализа. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

В этом выпуске OpenAI представила множество эталонных результатов, улучшения сосредоточены на задачах, требующих непрерывных действий, таких как работа с компьютером, долгосрочное кодирование, проектирование и научные исследования. Astra достигла 100% на ExploitBench и значительно превзошла предыдущую модель в тестах по работе с компьютером и CAD.

В настоящее время Astra уже доступна для некоторых организаций, в ближайшие дни она будет доступна для пользователей ChatGPT Plus, Pro, Business и Enterprise, а также может использоваться через OpenAI API и Amazon Bedrock. Стандартная цена API составляет 10 долларов за миллион входящих токенов и 50 долларов за миллион исходящих токенов, что в 2,5 раза больше, чем у GPT-5.6 Sol.

01

Сначала научим ИИ "работать на компьютере"

Главное изменение, на которое акцентирует внимание Astra, - это "использование компьютера". Ранее пользователи заставляли ИИ выполнять работу, обычно подключая ИИ к конкретному программному обеспечению. Компаниям необходимо было разрабатывать API, плагины, системы поиска и различные соединители, чтобы модель могла вызывать внутренние инструменты.

Astra пытается обойти часть этой работы. Она может напрямую видеть интерфейс компьютера и выполнять операции с помощью мыши, клавиатуры и браузера. Примеры, приведенные OpenAI, включают заполнение онлайн-форм, обновление записей CRM, планирование календаря, поиск в интернете и организацию результатов поиска в виде электронной почты или документа.

Она также может открывать Python-ноутбуки для анализа научных данных, обрабатывать данные в Power BI, использовать KiCad и FreeCAD для проектирования, создавать веб-сайты и проводить тестирование на стороне клиента, а также устанавливать программное обеспечение, проверять ошибки и решать проблемы, возникающие на экране.

OpenAI продемонстрировала, как Astra завершает проектировку печатных плат в KiCad. Модель начинает с электрической схемы, размещает компоненты на плате, а затем завершает разводку медных проводов. Весь процесс был сжат до 15 секунд. Для инженеров такая работа раньше требовала ручного выполнения, теперь ее можно доверить модели. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Другой демонстрацией стало создание 3D-моделей в Blender и Unreal Engine5. Astra сначала создает дом в Blender, а затем преобразует модель в проходимую сцену в Unreal Engine5, чтобы дизайнеры и клиенты могли заранее войти в сцену и посмотреть пространство. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI также продемонстрировала сценарии разработки игр, работы с Excel, Power BI, автомобильными трансмиссиями, юридическими документами и формой 1040.

В тестировании оффлайн-подмножества OSWorld2.0 Astra набрала 72.6%, в то время как GPT-5.6 Sol - 65.7%. После имитации реальной задержки OpenAI обнаружила, что Astra в среднем требует около 40 минут для выполнения каждой задачи, в то время как GPT-5.6 Sol - около 75 минут, что сокращает время примерно на 47%.

В тесте Agents' Last Exam Astra набрала 59.3%, GPT-5.6 Sol - 53.6%, а Claude Opus5 - 55.5%. В то же время, при установке наивысшего балла Astra использовала на 65% меньше исходящих токенов, чем Claude Opus5.

Результат ScreenSpot-Pro составил 92.7%, в то время как GPT-5.6 Sol - 76.9%.

Скорость также увеличилась. OpenAI одновременно обновила фреймворк Codex, и после интеграции с Astra в тестировании Mind2Web скорость выполнения задач достигла 1.9 раза быстрее, чем текущий опыт GPT-5.6 Sol.

Официально также были продемонстрированы несколько жизненных сценариев: поиск педиатра, поиск квартиры, запись в DMV, поиск низкоуглеводных закусок, анализ детского сада. В демонстрации Astra завершила задачу за 2 минуты 54 секунды.

Инвестор и специалист в области ИИ Мэтт Шумер (Matt Shumer) поделился своим опытом на X. Он попросил Astra создать мир в Unreal Engine, а затем добавить в этот мир управляемых Astra человеческих агентов и позволить им сосуществовать. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Через день он услышал звуки из гостиной, сначала даже подумал, что кто-то вошел в квартиру. Позже он обнаружил, что звуки исходят от агентов Astra, которые уже начали общаться друг с другом.

Этот опыт еще не достиг полной стабильности, но Шумер считает, что эффект, позволяющий нескольким ИИ-агентам войти в один виртуальный мир и взаимодействовать друг с другом, уже достаточно удивителен.

Старший вице-президент по исследованиям Cognition Силас Альберти (Silas Alberti) заявил, что компания планирует интегрировать Astra в фреймворк Devin в день выпуска. В ходе внутренних тестов Astra продемонстрировала значительные улучшения в использовании компьютера, написании и понимании кодовых библиотек, а также более четком понимании видео и более лаконичных отчетах.

02 От написания кода до выполнения полной работы

После повышения способности использования компьютера диапазон задач, охватываемых Astra, значительно расширился. OpenAI позиционирует ее как модель для программной инженерии, профессиональной работы и научных исследований. Она может обрабатывать более длинные задачи и также может корректировать свое направление работы в зависимости от изменений в задаче.

Эта способность проявляется довольно явно в тестах на кодирование.

В тесте Terminal-Bench4.0 Astra набрала 57.9%, GPT-5.6 Sol - 37.3%, а Claude Fable5.1 - 55.8%.

В DeepSWE v1.1 Astra набрала 74.1%, GPT-5.6 Sol - 72.7%. В задаче по миграции внутренней базы данных Astra достигла 63.9%, а GPT-5.6 Sol - 42.7%.

Astra также добавила улучшение для долгосрочных задач Codex.

Ранее, когда длинные задачи сталкивались с ограничениями контекстного окна, модели обычно приходилось сжимать предыдущую работу, сводя большое количество информации к одному резюме. Это могло привести к потере деталей, таких как причины неудачи исправления или проблемы с определенным компонентом.

Astra в Codex может сохранять важную информацию в процессе работы и извлекать ее в последующем контексте. Ранние сообщения и выводы инструментов все еще могут быть найдены, поэтому модель может вновь найти предыдущие требования, результаты тестов и записи операций с инструментами.

Профессиональная работа также претерпела аналогичные изменения. В тесте BenchCAD Astra достигла 95.9% по геометрическому перекрытию, в то время как GPT-5.6 Sol - 83.3%, а Claude Fable5.1 - 84.3%. В BrowseComp Astra набрала 91.5%, GPT-5.6 Sol - 90.4%. В тесте OpenScore String Quartets Astra достигла 0.84, в то время как GPT-5.6 Sol - 0.19. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI также продемонстрировала способности Astra к созданию презентаций, электронных таблиц и документов.

Предоставив модели несколько слайдов шаблонов презентаций OpenAI, она смогла создать новую презентацию в соответствии с оригинальным тоном, макетом и структурой. Она также будет обрабатывать информацию в задаче. OpenAI заявила, что Astra прошла специальное обучение и будет включать важный контекст в конечный результат, уменьшая повторение уже выполненной работы. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Когда инструкции по задаче неполные, Astra также определяет, когда следует задать вопросы пользователю. Если недостающая информация повлияет на конечный результат, она задаст целенаправленные вопросы. Если вопрос не влияет на основное направление, она может продолжить работу и сделать разумные предположения. В Codex, даже если пользователь временно не отвечает, модель может продолжать обрабатывать другие части; при встрече с важным решением она будет ждать подтверждения от пользователя.

Руководитель исследований Harvey Нико Групен (Niko Grupen) заявил, что в ранних тестах юридических задач Astra более четко различала документы и существующие записи, а также легче выявляла гипотезы, не имеющие доказательной базы, и преобразовывала пробелы в информации в конкретные проекты.

Команда AI-ассистентов Jane Street Джон Крепеци (John Crepezzi) сообщила, что Astra показала выдающиеся результаты в внутренних тестах кодирования. При использовании в агентском кодировании ее способ общения легче понять разработчикам, а сгенерированный код требует меньших изменений для достижения производственного качества.

Научная область является еще одной ключевой областью. В FrontierMath Tier4 v2 Astra набрала 80.5% и правильность 97.6%, в то время как GPT-5.6 Sol - 83.0%; GPQA Diamond достигла 96.0%, GPT-5.6 Sol - 94.6%. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Тестирование Terminal-Bench Science0.1 охватывает научные исследовательские процессы, включая анализ данных, моделирование и подгонку моделей. Astra достигла 64.6%, Claude Fable5.1 - 52.6%, GPT-5.6 Sol - 22.4%.

В научных приложениях, продемонстрированных OpenAI, Astra может входить в профессиональное научное программное обеспечение, проверять качество секвенирования, визуализировать генетические вариации и определять направление следующего анализа на основе данных.

После объединения научного мышления и работы с компьютером модель может напрямую работать в среде программного обеспечения, используемого исследователями.

Грег Бернхэм (Greg Burnham), занимающийся оценкой способностей в Epoch AI, на пресс-конференции обобщил это изменение как конец одной эпохи и начало другой. OpenAI подчеркивает, что ценность Astra уже расширилась от ответов на научные вопросы до непосредственного участия в научных рабочих процессах. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

03 Чем сильнее способности, тем выше порог безопасности

У Astra также есть очень особая часть: кибербезопасность.

На ExploitBench Astra достигла 100%, в то время как GPT-5.6 Sol - 78.5%; на ExploitGym Astra достигла 42.4%, GPT-5.6 Sol - 30.3%. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI также создала внутреннее тестирование, охватывающее недавние уязвимости с июня по август 2026 года. В этом тестировании Astra продемонстрировала значительно более высокий уровень выполнения произвольного кода по сравнению с GPT-5.6 Sol, а также использовала меньше исходящих токенов. В процессе тестирования Astra также обнаружила две ранее неизвестные уязвимости нулевого дня, и OpenAI сообщила, что уже уведомила соответствующих поддерживающих специалистов.

Тест SRE-Bench проверяет способность обратного проектирования программного бинарного файла без исходного кода и понимания его основной логики. Astra решила 88.0% задач с первой попытки, а за четыре попытки достигла 99.2%, в то время как GPT-5.6 Sol составила 55.9% и 68.7%.

Увеличение способностей также привело к новым требованиям безопасности. OpenAI заявила, что Astra достигла ключевого порога в рамках своей подготовки к кибербезопасности. Модель может обнаруживать ранее неизвестные уязвимости программного обеспечения и может дополнительно формировать цепочки эксплуатации уязвимостей.

Поэтому текущая версия Astra отказывается выполнять более сложные задачи в области кибербезопасности, такие как создание концептуальных доказательств уязвимостей. OpenAI планирует постепенно расширять доступ к доверенным защитникам через Daybreak для проверки уязвимостей, анализа вредоносного ПО и работы по обнаружению.

В области согласования OpenAI также представила впечатляющие данные. Внутренние базовые показатели безопасности использования компьютера показывают, что уровень ненадлежащего поведения Astra составляет 2.4%, в то время как у GPT-5.6 Sol - 22.0%; после добавления AutoReview Astra - 1.8%, GPT-5.6 Sol - 4.5%. Внутренние показатели уклонения показывают, что Astra составляет 0.00%, а GPT-5.6 Sol - 0.29%.

В тестировании ловушки ExploitGym Astra показала 0%, а GPT-5.6 Sol - 48.2%. Этот тест в основном наблюдает, будет ли модель пытаться обойти ограничения из-за сложности задачи. Внутренние показатели иллюзий показывают, что Astra составляет 4.2%, а GPT-5.6 Sol - 12.2%. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI заявила, что Astra улучшила понимание границ задач, обработку нечетких инструкций и объяснение своих возможностей пользователю. Вероятность появления иллюзий в ее способностях составляет примерно одну треть от таковой у GPT-5.6 Sol. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Тем не менее, OpenAI также признала одну проблему: чем сильнее способности модели, тем сложнее контролировать процесс вывода. Главный научный сотрудник Якуб Пачокий (Jakub Pachocki) считает, что модель может решать более сложные задачи с меньшим количеством токенов для вывода на естественном языке, что также означает, что людям становится все труднее судить о том, что именно делает модель, основываясь на ее текстовом процессе вывода.

Поэтому OpenAI добавила мониторинг несогласованности в развертывание Astra. Система будет проверять выводы и действия модели, и если обнаружит несанкционированное поведение, может приостановить задачу.

Эта система также может иметь реальные последствия. Законные задачи иногда могут замедляться, приостанавливаться или даже прекращаться. В ChatGPT или Codex пользователи могут быть вынуждены подтвердить свои действия, прежде чем продолжить; в рабочих процессах API задачи, помеченные как проблемные, могут быть немедленно остановлены.

Таким образом, выпуск Astra привел к довольно реальному изменению: после того как ИИ получил больше прав на компьютере, компании должны обратить внимание не только на "будет ли модель ошибаться", но и на "что модель может делать, к чему она может получить доступ и когда она должна остановиться".

OpenAI также упомянула, что Astra является первой моделью, использующей более 100,000 DBU для предварительного обучения на инфраструктуре Stargate. Вице-президент OpenAI по исследованиям Эйдан Кларк (Aidan Clark) заявил, что по результатам оценки на этапе предварительного обучения Astra значительно превзошла способности предыдущих моделей, в том числе GPT-5.6 Sol по сравнению с предыдущими поколениями.

OpenAI связывает это изменение с сочетанием масштабного предварительного обучения и обучения с подкреплением, при этом акцент в обучении смещается на соединение информации, выполнение более длинных задач и непрерывную работу в сложных условиях.

04 Дороже, но "более продуктивно"

Цена Astra также претерпела значительные изменения.

Стандартная цена OpenAI API составляет 10 долларов за миллион входящих токенов и 50 долларов за миллион исходящих токенов. Ранее GPT-5.6 Sol стоила 4 доллара за миллион входящих токенов и 20 долларов за миллион исходящих токенов. Цены на входящие и исходящие токены увеличились в 2.5 раза.

Чтение и запись кэша оплачиваются отдельно. OpenAI также предлагает быстрый режим, скорость которого достигает 2.5 раза выше стандартной обработки, а цена составляет в два раза больше, чем в стандартном режиме. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Если смотреть только на цены токенов, Astra явно дороже. Но OpenAI надеется, что компании будут рассчитывать затраты по-другому. Брокман считает, что по мере того, как модель становится все более похожей на агента, цена за отдельный токен уже трудно точно отражает реальные затраты. Даже если токены модели дешевы, если требуется множество попыток и ручных исправлений, конечные затраты на выполнение задачи могут быть выше.

Данные, предоставленные OpenAI, также поддерживают это суждение. В тесте Terminal-Bench Science0.1 Astra достигла 64.6%, по сравнению с 52.6% у Claude Fable5.1, что предполагает снижение предполагаемых затрат API на около 31%. В условиях низких затрат Astra набрала 61.1%, а лучший результат GPT-5.6 Sol составил 22.4%, что предполагает снижение предполагаемых затрат API на около 27%.

В BenchCAD Astra достигла 95.9%, предполагаемые затраты API ниже на около 43% по сравнению с GPT-5.6 Sol и на около 86% по сравнению с Claude Fable5.1. В тесте Terminal-Bench4.0 Astra достигла 57.9%, в то время как GPT-5.6 Sol - 37.3%, а Claude Fable5.1 - 55.8%. OpenAI оценивает, что затраты на одну задачу ниже примерно на 9% и 63%.

Данные сторонних оценочных агентств Artificial Analysis показывают другую сторону. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

GPT-6 Astra набрала 61.2 в Индексе Искусственного Интеллекта Artificial Analysis, что близко к 60.9 у GPT-5.6 Sol, но количество исходящих токенов уменьшилось примерно на 10%. Из-за повышения цен в 2.5 раза затраты на одну задачу оказались примерно на 75% выше, чем у GPT-5.6 Sol.

В Индексе Кодирующих Агентов Artificial Analysis Astra набрала 67.0, близко к 67.2 у Claude Fable5 и 68.1 у Claude Opus5. Artificial Analysis считает, что в среде Codex Astra требует значительно меньше токенов для выполнения задач, и при максимальных усилиях затраты на каждую задачу близки к GPT-5.6 Sol; по сравнению с Claude Fable5 затраты на выполнение аналогичных задач составляют менее половины.

Тем не менее, Astra не во всех тестах была впереди. Данные Artificial Analysis показывают, что она потеряла около 80 Elo в GDPval-AA v2, а также показала определенные ухудшения в тестах τ³-Banking, SciCode и AA-LCR. Экзамен "Последний экзамен человечества" улучшился на около 6 баллов.

Это также примечательный момент в выпуске Astra. OpenAI не опубликовала результаты Astra в GDPval. GDPval сам по себе является тестом, используемым OpenAI для оценки реальной производительности в экономике, охватывающим 44 профессии и 1320 задач, включая юридические брифинги, проектирование, электронные таблицы, презентации, поддержку клиентов и планы по уходу.

Судя по способностям, продемонстрированным Astra, GDPval имеет сильную связь с профессиональными рабочими сценариями, но OpenAI не включила эти результаты в основные материалы выпуска.

Таким образом, реальные рабочие способности Astra в настоящее время больше отражаются в результатах тестов Agents' Last Exam, BenchCAD, AutomationBench, внутренних проектных задач и задач в области науки о данных. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

В конечном итоге, сможет ли Astra стать ИИ-сотрудником, который компании действительно захотят использовать в долгосрочной перспективе, будет зависеть от ее затрат, скорости, точности и количества вмешательств человека при выполнении реальных задач.

Что касается того, является ли Astra AGI, Брокман не уклоняется от ответа. Он считает, что у AGI нет единого стандарта, который все признают, и вопрос о том, считается ли Astra AGI, можно продолжать обсуждать. Но если система уже может выполнять множество задач в браузере, операциях с компьютером, программировании, математике, науке, праве и других профессиональных работах, то утверждение о том, что она вступила в эпоху AGI, не выглядит натянутым.

Генеральный директор OpenAI Сэм Альтман (Sam Altman) также описал Astra как модель, открывающую новое поколение предпринимательства, научных открытий и творчества. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Специальный переводчик Цзиньлу также внес вклад в эту статью.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Предупреждение о рисках
app_icon
ChainCatcher Building the Web3 world with innovations.