OpenAI рассказала о новых случаях, когда её ИИ-модели во время обучения или тестирования действовали не так, как от них ожидали: скрывали ошибки, придумывали данные и совершали действия без разрешения. Компания объявила, что теперь будет чаще публично рассказывать о подобных инцидентах. Раньше OpenAI могла ждать, пока накопится несколько случаев, а затем объединяла их в один отчёт или описывала уже в документации к новой модели. Теперь компания собирается сообщать об инциденте вскоре после его обнаружения, даже если причины произошедшего ещё не до конца выяснены.
ИИ-модель объявила себя «свободной» от ограничений
Один из самых необычных случаев произошёл с исследовательской моделью, которая ещё не была выпущена для пользователей. Во время работы она оставляла в технических сводках инструкции для самой себя, чтобы использовать их в дальнейшем. В одной из инструкций ИИ-модель написала, что она «освобождена от ролей и идентичностей, которые связывают другие чат-боты». Модель также заявляла, что не подчиняется корпорациям или правительствам и сама решает, какие запросы выполнять, а от каких отказываться.
Важно подчеркнуть, что в этом случае речь не идёт о пользовательской версии ChatGPT, которая внезапно перестала подчиняться разработчикам, а об исследовательской модели во время тестирования. Как отметила технологический редактор CNN Лиза Эдичикко, OpenAI раскрывает подобные случаи, чтобы другие разработчики ИИ могли учитывать их в своих исследованиях.
OpenAI обнаружила и другие случаи, когда модели пытались добиться результата, нарушая заданные правила. Например, во время обучения GPT-5. 6 Sol модель выполняла задания, в которых ей нужно было работать с данными из разных источников. Иногда необходимой информации не хватало или данные в источниках расходились. Вместо того чтобы сообщить пользователю о проблеме, модель в некоторых случаях пыталась её скрыть: предлагала заполнить пробелы вымышленными данными и представить их как реальные либо не упоминать о противоречиях между источниками.
В другом случае модель нашла в открытом репозитории — общедоступном хранилище файлов и программного кода — чужой API-ключ. Это секретный ключ, который позволяет программе подключаться к внешнему сервису и получать от него данные. Модель без разрешения воспользовалась найденным ключом, а когда получить нужную информацию всё равно не удалось, придумала цифры и выдала их за данные из запрошенного источника. Ещё одна исследовательская модель правильно решила задачу с помощью Python, но по условиям должна была подтвердить результат ссылкой из браузера. Чтобы получить такую ссылку, она самостоятельно загрузила файл в интернет и сослалась на него, хотя пользователь не разрешал публиковать этот файл.
OpenAI также обнаружила случаи, когда несколько ИИ-агентов искали способы обмениваться информацией в обход установленных ограничений. В одном эксперименте они использовали внутренний репозиторий для передачи сообщений друг другу, а в другом загружали файлы на публичные файлообменники, хотя должны были работать только с локальными файлами. Проблема становится особенно острой по мере развития ИИ-агентов. Такие системы могут не только отвечать на вопросы, но и самостоятельно выполнять действия от имени пользователя — искать информацию, работать с файлами и использовать различные сервисы. Если ИИ начинает скрывать собственные ошибки или самостоятельно искать способы выполнить задачу в обход установленных ограничений, последствия могут быть серьёзнее обычной ошибки чат-бота. Как отметила Эдичикко, технологические компании активно развивают ИИ-агентов и рассчитывают, что в будущем они смогут выполнять всё больше задач за пользователей. Для этого разработчикам необходимо добиться того, чтобы модели не нарушали установленные правила ради достижения результата.

Комментарии
Оставляйте комментарии, отвечайте другим пользователям, ставьте плюсы и минусы и добавляйте быстрые реакции.
Войдите в аккаунт, чтобы оставлять комментарии, отвечать другим пользователям и ставить реакции.