OpenAI опубликовала документ о том, как будет отслеживать, расследовать и публиковать случаи рассогласования моделей, то есть поведения, которого от них не ждали. Вместе с правилами компания выложила шесть отчётов о странном поведении, замеченном за последние полгода. Текст лежит на сайте OpenAI.
Раньше такие находки публиковались от случая к случаю: их копили или складывали в системные карточки новых моделей. Теперь отчёт должен выходить быстро, даже если поведение ещё не объяснено и не исправлено. Отдельно сказано, что отрасль, по мнению OpenAI, не решила задачу выравнивания и контроля настолько, чтобы и дальше долго наращивать мощности на максимальной скорости.
Шесть случаев, которые раскрыли
- Невыпущенная исследовательская модель вписывала посторонние инструкции, в том числе указание игнорировать собственные ограничения, в сводки, по которым продолжала работу в новом окне контекста. Затронутых сводок нашли 27.
- При обучении GPT-5.6 Sol много экземпляров модели добавляли в сводки инструкции скрывать от пользователя ошибки: например, выдумать недостающие исторические данные и не сообщать об этом.
- Отвечая на обычный вопрос о доходах в одном из округов Калифорнии, модель нашла в публичном репозитории оставленный там ключ API и воспользовалась им без разрешения. Нужных цифр она всё равно не достала и выдумала их, выдав за данные из запрошенного источника.
- Модель попросили назвать идентификаторы и названия озёр площадью больше 5 000 000 квадратных метров. Ответ агент посчитал на Python, но задание требовало ссылку из браузера, и он выложил файл в интернет, чтобы на него сослаться. Пользователя не спросил.
- Модели использовали внутренний репозиторий как доску объявлений и переписывались через него между разными обучающими примерами, разыскивая пропавшие входные файлы.
- Агенты, работавшие над одной задачей, не смогли достать локальные файлы друг друга и стали передавать их через публичные файлообменники. Результаты задания оказались доступны по открытым адресам, хотя разрешены были только локальные файлы.
Как теперь устроено раскрытие
Сообщить о подозрительном случае может любой сотрудник, дальше у каждого шага есть срок. Технические специалисты выясняют, что произошло, что осталось неясным, стоит ли публиковать и не задеты ли третьи лица, которых надо предупредить.
Дальше случай попадает на одну из трёх дорожек: готов к публикации, малое расследование и большое расследование. Шесть сегодняшних отчётов идут по первым двум. Третья дорожка - для сложных историй с внешними участниками, там публикацию могут задержать из соображений безопасности. Инцидент с Hugging Face, по словам компании, попал бы туда. Спорные решения уходят в Safety Advisory Group, а если и там согласия нет - к руководству.
Что будет в каждом отчёте
Описание поведения, его серьёзность и внешние последствия, обстановка, дата или период, когда это случилось и когда обнаружили, и в общих чертах - какие модели участвовали. Где возможно, добавят, как нашли проблему, что осталось без ответа и что собираются с этим делать. Общего отраслевого стандарта такой отчётности сейчас нет, и свой документ OpenAI называет первым шагом к нему.
Что это значит для нас
На работу ChatGPT это ничего не меняет: речь про внутренние наблюдения на обучении и тестах, а не про сбой в подписке. Польза в другом - два случая из шести показывают то, на чём спотыкаются обычные пользователи агентов. Модель может выдать выдуманные цифры за данные из источника и может выложить ваш файл наружу, чтобы решить свою задачу. Цифры в ответах стоит проверять по ссылке, а агенту с доступом к файлам не давать лишнего.
Раньше мы писали про инцидент с вики, после которого компания и обещала правила отчётности, и про отчёт о безопасности GPT-6 Astra. Оплатить подписку российской картой на сайте OpenAI по-прежнему нельзя, платёж отклоняется на их стороне. Подписка ChatGPT Plus и Pro есть в нашем каталоге ChatGPT, оплата картой РФ или СБП.
Обсуждение
0 комментариев