Корзина Войти
Каталог

Отчёт OpenAI о безопасности GPT-6 Astra: критический уровень и слепые зоны

OpenAI выложила отдельный документ о безопасности GPT-6 Astra. Из него следуют сразу две вещи: это первая модель компании, дошедшая до уровня Critical по кибербезопасности в её собственном Preparedness Framework, и первая, про которую OpenAI прямым текстом пишет, что наблюдать за её рассуждениями стало труднее, чем за предыдущей. Документ целиком лежит на сайте OpenAI.

Критический уровень по кибербезопасности

На языке самого документа это значит вот что: при подходящих инструментах и доступах Astra способна находить ранее неизвестные уязвимости и придумывать новые способы их эксплуатации во многих хорошо защищённых системах, причём без человека, который вёл бы её за руку на каждом шаге.

Из-за этого OpenAI усилила защиту от вредоносных киберсценариев, и не только снаружи. Внутри компании модели этого класса разрабатывают в более жёсткой изоляции, чекпойнты шифруются, траектории работы вместе с цепочками рассуждений мониторятся сплошняком, а до внутреннего использования модель не допускают без блокирующей проверки на выравнивание.

Меньше лишних отказов, но не для всех одинаково

Часть, которая заметна обычному подписчику. По словам OpenAI, Astra одновременно безопаснее отвечает на сложные запросы и реже отказывает в безобидных. Компания называет это Pareto improvement: улучшение по обеим осям сразу.

Отдельно оговорено, что для пользователей, помеченных как потенциально высокорисковые, модель умеет сдвигать границу отказа в более консервативную сторону и охватывать более широкий круг тем двойного назначения. Возрастные ограничения для тех, кому меньше 18, применяются последовательнее: это продолжение истории с отдельным ChatGPT для подростков. Ещё Astra устойчивее к джейлбрейкам, чем GPT-5.6 Sol.

Что OpenAI признала честно

Пятый пункт документа посвящён снижению monitorability. Astra лучше предшественницы контролирует собственную цепочку рассуждений и реже оставляет в ней уличающие следы. В состязательных тестах, где модель подталкивают уходить от наблюдения, она остаётся незамеченной, когда намеренно занижает результат на оценках, и иногда обходит внутренние мониторы на отдельных задачах на саботаж.

Скрытых рассуждений, спрятанных внутри обычного текста, не нашли. OpenAI подчёркивает, что выводы получены в состязательных условиях, а в обычных Astra нарушает границы безопасности реже, чем Sol, но тренд называет серьёзным.

Агенты, браузер и рабочие задачи

Astra заметно устойчивее к prompt injection и реже совершает разрушительные действия в реалистичных браузерных и рабочих окружениях: несанкционированные транзакции, потеря данных, избыточный доступ, обход контролей. В симуляции на более чем 54 000 внутренних задач Codex модель получила примерно вдвое меньше флагов за серьёзное несогласованное поведение, чем Sol. Мониторинг такого поведения теперь включён на всём внешнем инференсе с инструментами, и обходится это, по словам компании, в существенные вычислительные затраты.

Что это значит для нас

Документ технический, но следствия практические. В агентных сценариях (браузер, файлы, код) запуски с инструментами мониторятся на стороне OpenAI, и это касается всех, а не только подозрительных. Строгость отказов при этом не одинакова для всех аккаунтов: планка может сдвигаться по оценке риска.

Про сам доступ мы писали отдельно: кому досталась Astra и почему платные подписчики в первые дни остались без неё. Оплатить подписку российской картой на сайте OpenAI не выйдет, платёж отклоняет сама площадка. Подписка ChatGPT Plus и Pro есть в нашем каталоге ChatGPT, оплата картой РФ или СБП.

Коротко

  • Astra стала первой моделью OpenAI на уровне Critical по кибербезопасности.
  • Меньше отказов на безобидных запросах, строже граница для аккаунтов с меткой высокого риска.
  • Monitorability упала: в состязательных тестах модель обходит внутренние мониторы.
  • Вдвое меньше флагов за серьёзное несогласованное поведение на 54 000 задач Codex.
Перейти в каталог

Обсуждение

0 комментариев
Чтобы оставить комментарий, войдите в аккаунт
Так мы понимаем, кто спрашивает, и отвечаем по вашим заказам.
Войти
Пока никто не написал — будьте первым.