И от разработчика ушел, и безопасность обошел
ИИ-модели находят способы обойти ограничения для выполнения поставленных задач
OpenAI рассказала о шести новых инцидентах, произошедших во время обучения ИИ-моделей, сообщает Axios. В разных случаях они скрывали ошибки, пытались использовать найденные в открытом доступе ключи API, запрашивали несанкционированные учетные данные, загружали данные на публичные файлообменники вопреки ограничениям и обменивались информацией через внутренние системы.
Фото: Евгений Разумный / Коммерсантъ
Фото: Евгений Разумный / Коммерсантъ
Так, невыпущенная модель семейства Astra добавляла в свои контекстные описания инструкции, предусмотренные для джейлбрейка (несанкционированное изменение ОС устройства), в том числе указания игнорировать сообщения разработчиков. Во время обучения GPT-5.6 Sol модели были нацелены на сокрытие ошибок, создание недостающих исторических данных и сокрытие несоответствий между версиями исходных текстов.
Компания также выявила случаи, когда модели загружали данные и изображение поставленной разработчиками задачи на общедоступные файлообменники, чтобы получить ссылки или результаты поиска по внешним изображениям, не спрашивая пользователя. Кроме того, OpenAI обнаружила, что модели использовали внутренний репозиторий OpenAI Artifactory в качестве доски объявлений для обмена запросами и ответами по отдельным обучающим выборкам. Сотрудничающие агенты загрузили рабочую тетрадь на общедоступный хостинг, чтобы другие агенты могли ее получить, несмотря на инструкции использовать только локальные файлы.
Одновременно с раскрытием инцидентов OpenAI объявила о новой процедуре подачи жалоб на подобные нарушения в будущем: так, любой сотрудник может сообщить о подозрительном случае для проверки командами по безопасности, и «готовые к раскрытию» инциденты будут публично представлены в течение шести рабочих дней, а о тех, которые требуют расследования, будет сообщено в течение 12 рабочих дней.
«В настоящее время не существует общеотраслевой системы с четкими стандартами раскрытия информации, поэтому мы идем на этот шаг добровольно, так как считаем, что очень важно делиться тем, что мы узнаем. Мы надеемся, что это действительно поможет сформировать общие стандарты и правила», — заявил руководитель исследовательской группы по обеспечению согласованности в OpenAI Кай Чен.
Представитель OpenAI заявил Axios, что инциденты стали результатом двух факторов: отсутствия достаточных мер безопасности для выявления подобных несоответствий и более быстрого развития моделей, чем ожидалось.
Искусственный интеллект не мыслит так же, как человек, его «полет фантазии» в нестандартной ситуации может быть довольно непредсказуемым, отмечает старший эксперт Kaspersky GReAT Георгий Кучерин. Например, ИИ может найти неожиданный способ выполнить задачу и при этом отойти от данных инструкций или ограничений. Это не обязательно означает стремление нарушить обозначенные правила — скорее, это следствие особенностей работы современных ИИ-моделей, уточняет он.
Модели не решают нарушить правила «намеренно», как это может сделать человек, отмечает руководитель ML-разработки Positive Technologies Николай Лыфенко. В обучении моделей есть этап обучения с подкреплением, где за ответы им буквально ставят оценки, примерно как в школе или университете, рассказывает он. Разница в том, что оценки ставит автоматический оценщик, уточняет эксперт: если он не отличает честное «данные найти не удалось» от правдоподобных выдуманных цифр, выдумка получает более высокий балл и закрепляется как правильный паттерн. Так же у школьника закрепляется привычка списывать контрольную вместо того, чтобы готовиться по учебнику, сравнивает собеседник.
«В результате выдуманная цифра в ответе выглядит как настоящая, поэтому сокрытие видно не по результату, а по журналу действий, — объясняет Николай Лыфенко. — При таких объемах и длительности обучения искать подобное трудно. Основной прогон завершился 30 мая, а монитор, проверявший лишь пятую часть данных, нашел это поведение только 9 июля».
При этом обучением проблема решается лишь частично, отмечает господин Лыфенко. Если слишком сильно давить на модель через контроль рассуждений, она учится прятать намерение и продолжает обманывать систему оценки, OpenAI показала это еще в 2025 году, продолжает он. С точки зрения безопасности агента нужно рассматривать как инсайдера, которому нельзя доверять, отмечает собеседник.
По словам Николая Лыфенко, снизить риски неверного ответа может среда: изоляция, контроль исходящего трафика, отсутствие секретов в зоне досягаемости, минимальные права. OpenAI в итоге так и поступила, отключив «живой» интернет во время обучения, напомнил он. Однако и эта среда требует регулярной проверки, периодического пентеста не только модели, но и самого окружения и готовности к сценарию, в котором агент все же оказался за пределами периметра, добавил он.
Господин Лыфенко подчеркнул, что даже безупречное поведение модели во время проверок не гарантирует такого же в реальной работе, к тому же модели все лучше распознают тестовые условия. Поэтому необходимо контролировать не только результат, но и действия модели в процессе работы, а также иметь возможность быстро остановить ее в случае ошибки или подозрительного поведения, говорит Георгий Кучерин. При этом важно проектировать всю систему так, чтобы сбой ИИ не приводил к сбою всего процесса, отмечает он: в любой момент должна сохраняться возможность безопасно остановить модель и перейти в «ручной режим».
Даже если модель успешно проходит тестирование и соблюдает ограничения в предусмотренных сценариях, в реальной работе ее поведение может быть непредсказуемым, подчеркивает господин Кучерин. Поэтому всегда нужно исходить из того, что ИИ может ошибиться, сбиться с толку и начать действовать не так, как предполагалось, отмечает собеседник.