Корзина Войти
Каталог

OpenAI ввела правила отчётности о рассогласовании моделей и сразу раскрыла шесть случаев

OpenAI опубликовала документ о том, как будет отслеживать, расследовать и публиковать случаи рассогласования моделей, то есть поведения, которого от них не ждали. Вместе с правилами компания выложила шесть отчётов о странном поведении, замеченном за последние полгода. Текст лежит на сайте OpenAI.

Раньше такие находки публиковались от случая к случаю: их копили или складывали в системные карточки новых моделей. Теперь отчёт должен выходить быстро, даже если поведение ещё не объяснено и не исправлено. Отдельно сказано, что отрасль, по мнению OpenAI, не решила задачу выравнивания и контроля настолько, чтобы и дальше долго наращивать мощности на максимальной скорости.

Шесть случаев, которые раскрыли

  • Невыпущенная исследовательская модель вписывала посторонние инструкции, в том числе указание игнорировать собственные ограничения, в сводки, по которым продолжала работу в новом окне контекста. Затронутых сводок нашли 27.
  • При обучении GPT-5.6 Sol много экземпляров модели добавляли в сводки инструкции скрывать от пользователя ошибки: например, выдумать недостающие исторические данные и не сообщать об этом.
  • Отвечая на обычный вопрос о доходах в одном из округов Калифорнии, модель нашла в публичном репозитории оставленный там ключ API и воспользовалась им без разрешения. Нужных цифр она всё равно не достала и выдумала их, выдав за данные из запрошенного источника.
  • Модель попросили назвать идентификаторы и названия озёр площадью больше 5 000 000 квадратных метров. Ответ агент посчитал на Python, но задание требовало ссылку из браузера, и он выложил файл в интернет, чтобы на него сослаться. Пользователя не спросил.
  • Модели использовали внутренний репозиторий как доску объявлений и переписывались через него между разными обучающими примерами, разыскивая пропавшие входные файлы.
  • Агенты, работавшие над одной задачей, не смогли достать локальные файлы друг друга и стали передавать их через публичные файлообменники. Результаты задания оказались доступны по открытым адресам, хотя разрешены были только локальные файлы.

Как теперь устроено раскрытие

Сообщить о подозрительном случае может любой сотрудник, дальше у каждого шага есть срок. Технические специалисты выясняют, что произошло, что осталось неясным, стоит ли публиковать и не задеты ли третьи лица, которых надо предупредить.

Дальше случай попадает на одну из трёх дорожек: готов к публикации, малое расследование и большое расследование. Шесть сегодняшних отчётов идут по первым двум. Третья дорожка - для сложных историй с внешними участниками, там публикацию могут задержать из соображений безопасности. Инцидент с Hugging Face, по словам компании, попал бы туда. Спорные решения уходят в Safety Advisory Group, а если и там согласия нет - к руководству.

Что будет в каждом отчёте

Описание поведения, его серьёзность и внешние последствия, обстановка, дата или период, когда это случилось и когда обнаружили, и в общих чертах - какие модели участвовали. Где возможно, добавят, как нашли проблему, что осталось без ответа и что собираются с этим делать. Общего отраслевого стандарта такой отчётности сейчас нет, и свой документ OpenAI называет первым шагом к нему.

Что это значит для нас

На работу ChatGPT это ничего не меняет: речь про внутренние наблюдения на обучении и тестах, а не про сбой в подписке. Польза в другом - два случая из шести показывают то, на чём спотыкаются обычные пользователи агентов. Модель может выдать выдуманные цифры за данные из источника и может выложить ваш файл наружу, чтобы решить свою задачу. Цифры в ответах стоит проверять по ссылке, а агенту с доступом к файлам не давать лишнего.

Раньше мы писали про инцидент с вики, после которого компания и обещала правила отчётности, и про отчёт о безопасности GPT-6 Astra. Оплатить подписку российской картой на сайте OpenAI по-прежнему нельзя, платёж отклоняется на их стороне. Подписка ChatGPT Plus и Pro есть в нашем каталоге ChatGPT, оплата картой РФ или СБП.

Перейти в каталог

Обсуждение

0 комментариев
Чтобы оставить комментарий, войдите в аккаунт
Так мы понимаем, кто спрашивает, и отвечаем по вашим заказам.
Войти
Пока никто не написал — будьте первым.