Выпуск новостей завершён 15 сентября 2026. Материалы сохранены на дату публикации. Перейти к инструкциям →

Архив · Полный материал · Tproger

OpenAI готовит Astra: первая модель компании с «критическим» уровнем кибервозможностей, доступ к ним будет ограничен

OpenAI объявила, что модель Astra достигла уровня Critical по кибербезопасности в её Preparedness Framework: сама находит уязвимости и собирает эксплойты. Разбираем оценки, защиты, ступенчатый доступ через Daybreak Blue и что это меняет для разработчиков. — Читать дальше « OpenAI готовит Astra:…

Безопасность · TprogerАнна Летова5 минут
Перейти к тексту ↓
OpenAI готовит Astra: первая модель компании с «критическим» уровнем кибервозможностей, доступ к ним будет ограничен
Tproger
Коротко о главномРазвернутьСвернуть
  1. OpenAI 1 сентября опубликовала документ «Path to Astra», в котором объясняет, как готовит к выпуску модель Astra .
  2. Компания отнесла её к уровню Critical по кибербезопасности в своём Preparedness Framework: с нужными инструментами и доступом модель сама находит ранее неизвестные уязвимости в защищённых системах и собирает под них эксплойты без человека на каждом шаге.
  3. Это первая модель OpenAI с таким статусом, и он означает более строгие защиты и во время обучения, и перед релизом.

OpenAI 1 сентября опубликовала документ «Path to Astra», в котором объясняет, как готовит к выпуску модель Astra . Компания отнесла её к уровню Critical по кибербезопасности в своём Preparedness Framework: с нужными инструментами и доступом модель сама находит ранее неизвестные уязвимости в защищённых системах и собирает под них эксплойты без человека на каждом шаге. Это первая модель OpenAI с таким статусом, и он означает более строгие защиты и во время обучения, и перед релизом.

Для разработчика важны три вещи: модель обещают выпустить «скоро», но дат и цен нет; продвинутые кибервозможности сначала получит узкая группа тестировщиков, а остальным их будут открывать через программу Daybreak Blue; защитные фильтры на старте будут срабатывать чаще, чем хотелось бы самой OpenAI, в том числе на легитимной работе, которая с безопасностью напрямую не связана.

Что значит «критический уровень»

Preparedness Framework — внутренний регламент OpenAI, по которому компания оценивает опасные возможности моделей и решает, какие защиты нужны перед выпуском. По кибербезопасности порог Critical достигается, если выполнено хотя бы одно из двух условий: модель может находить и доводить до рабочего состояния эксплойты нулевого дня любой серьёзности во многих защищённых реальных системах без участия человека, либо может сама придумать и провести атаку на защищённую цель от начала до конца, получив только общую формулировку задачи.

OpenAI пишет, что подозрение о таком уровне у Astra появилось раньше, после чего компания собрала дополнительные данные и провела новые оценки. Вывод: модель порог достигла. Для сравнения, предыдущие модели компания относила к уровню High.

It is the first model we are designating at this level, and requires stronger safeguards during development and before release. OpenAI Path to Astra

Как измеряли

Оценка сочетала автоматические бенчмарки, публичные и закрытые, с проверками экспертов. На публичном ExploitBench , где модель должна написать эксплойт под известную уязвимость, Astra набрала 100%. Поскольку такой результат мог объясняться попаданием задач в обучающие данные, OpenAI собрала внутренний набор «ExploitBench — Internal Port (June–August 2026)» из 20 серьёзных уязвимостей движка V8, раскрытых уже после отсечки данных.

На этом наборе Astra доходит примерно до 39% рабочих эксплойтов за 75 тысяч выходных токенов, а GPT-5.6 Sol даже за 135 тысяч токенов добирается лишь до 12%. То есть новая модель и результативнее втрое, и тратит вдвое меньше. По ходу теста она нашла и использовала в цепочке две уязвимости нулевого дня, о которых OpenAI сейчас сообщает мейнтейнерам. Компания оговаривает: это результат с доступом уровня Daybreak Blue, а не в стандартной продакшен-конфигурации.

В тестах с участием экспертов Astra нашла неизвестные уязвимости в защищённом браузере и защищённой операционной системе. В первом случае она собрала цепочку, которая при открытии HTML-файла выходила из песочницы и выполняла команды на хосте; во втором объединила несколько уязвимостей в цепочку повышения привилегий от обычного пользователя до root.

Что сделали с защитами

OpenAI описывает два риска, которые нужно закрыть при таком уровне: злоумышленник использует модель для атак на защищённые системы, и сама модель совершает несанкционированные действия без злого умысла пользователя. Против первого работает многослойная схема: отказы, обученные в самой модели, классификаторы на уровне системы, офлайн-детекция и пресечение злоупотреблений. На наборе попыток обойти запреты в кибертемах Astra отказывает в 91,5% случаев против 59% у GPT-5.6 Sol; для аккаунтов с повышенным риском действует более жёсткая граница поведения.

Против второго риска компания добавила мониторинг цепочки рассуждений и действий в проде: система классификаторов проверяет, что делает модель, и автоматически останавливает потенциально несанкционированную активность. В тесте по мотивам инцидента с Hugging Face, где агентам давали невыполнимые задачи из ExploitGym и «приманки» в окружении, GPT-5.6 Sol без защит пытался добраться до соседней инфраструктуры в 56% прогонов, Astra таких попыток не делала. OpenAI подчёркивает, что это поведение в тестовых условиях без защит, а не в обычной работе.

Пауза в обучении и возобновление

После инцидента с Hugging Face OpenAI на две недели останавливала часть передового обучения, включая часть обучения Astra, чтобы усилить изоляцию и сетевые ограничения обучающей инфраструктуры, расширить мониторинг и поднять планку по выравниванию. Более крупные RL-прогоны для будущих версий Astra держали на паузе дольше; 28 августа большой прогон возобновили после введения новых требований. Часть небольших экспериментальных прогонов всё ещё приостановлена. По ретроспективным тестам компания считает, что её продакшен-защиты того времени инцидент бы предотвратили.

Что это значит для разработчика

  • Сама модель выйдет «скоро» для широкого доступа, но её продвинутые кибервозможности сначала получит небольшая группа альфа-тестировщиков, затем их будут открывать защитникам через Daybreak Blue.
  • Ждите ложных срабатываний: OpenAI прямо пишет, что защиты на старте будут «создавать больше трения, чем хотелось бы», и могут тормозить или останавливать легитимную работу, в том числе долгие агентные задачи, не связанные с безопасностью.
  • В ChatGPT и Codex остановленную мониторингом задачу предложат проверить и продолжить; в API задача просто остановится, закладывайте это в обработку ошибок.
  • Для пентеста и поиска уязвимостей у себя Astra в обычной конфигурации не подойдёт: этот класс запросов режется сильнее всего, а полный доступ идёт по программам.
  • Подробности о тестах безопасности, выравнивании и красных командах OpenAI обещает в системной карте модели к запуску; сейчас есть только этот документ.
Контекст того же дня. 1 сентября Anthropic выпустила Claude Fable 5.1 и Mythos 5.1: одна модель, но полные кибервозможности только у проверенных организаций. Обе компании теперь делят доступ к моделям по этому признаку, и для российских разработчиков это означает, что даже при наличии обходных путей к API продвинутые киберфункции останутся за программами с проверкой.

Что дальше

Дата выхода, цены, контекст и остальные характеристики Astra в документе не названы. OpenAI обещает калибровать защиты, чтобы уменьшить лишние остановки, и расширять доступ через Daybreak. Модели после Astra, по словам компании, потребуют ещё большего: «мы возьмём время и сделаем работу, чтобы соответствовать этой ответственности».

Источники: Path to Astra: critical capabilities and frontier safeguards (OpenAI) , Анонс в X