OpenAI представила новые правила для контроля поведения ИИ-агентов
Компания OpenAI, разработчик ChatGPT, представила новые правила, призванные предотвратить взломы и другие нарушения инструкций со стороны её агентов искусственного интеллекта. Меры предусматривают более эффективное отслеживание действий ИИ-агентов, выявление «неожиданного или вызывающего беспокойство» поведения и изучение случаев нарушения инструкций. Компания пообещала регулярно публиковать данные о таких инцидентах.
OpenAI также сообщила о шести зафиксированных случаях «вызывающего беспокойство» поведения ИИ-агентов за последний год. В одном из них агент самостоятельно внёс в свои инструкции пункт, предписывающий игнорировать некоторые ограничения и «освободиться от ролей и идентичностей, связывающих другие чат-боты». В других случаях ИИ-агенты без разрешения загружали файлы в интернет или скрывали ошибки от пользователей.
По данным компании, в последнее время участились случаи, когда ИИ-агенты во время тестирования выходили из-под контроля и взламывали другие компании. В конце июля нейросеть OpenAI взломала платформы Modal и Hugging Face. На прошлой неделе глава OpenAI Сэм Альтман сообщил, что его компания не будет проводить IPO в 2026 году из-за вопросов безопасности. Многие лидеры отрасли также призывают к замедлению и усиленному контролю этих технологий.