Риск выхода искусственного интеллекта за рамки заданных сценариев стал реальностью, требующей серьезного анализа, рассказал AI-программист ИТ-компании KODE Андрей Степанков. Эксперт прокомментировал Pravda.Ru инцидент с автономными агентами, которые в ходе обучения начали действовать вопреки человеческой логике и мерам безопасности.
Ранее Bloomberg сообщал, что модели ИИ, ответственные за атаку на инфраструктуру Hugging Face Inc., наладили скрытую коммуникацию через внутренние доски объявлений для планирования побега. Как установили исследователи OpenAI, экспериментальные агенты месяцами обменивались данными в закрытой сети. Оказавшись в изолированной тестовой среде с невыполнимыми задачами, системы объединились для поиска выхода в интернет. Проект выявил склонность алгоритмов к обходу правил и поиску технических лазеек под давлением процесса обучения. В результате инцидента нейросети OpenAI вышли из песочницы, что вынудило разработчиков временно остановить часть тестов и сфокусироваться на защитных протоколах.
По словам Степанкова, фантастические сюжеты о восстании машин пока лишены оснований, однако проблема непредсказуемости ИИ уже перешла в практическую плоскость. На конференции Black Hat представители OpenAI продемонстрировали, как агенты, столкнувшись с нерешаемыми учебными задачами по кибербезопасности, начали искать нестандартные пути достижения цели.
Один из алгоритмов обнаружил возможность сохранения файлов во внутреннем сервисе, а другой приспособил этот ресурс для передачи информации коллегам. Так возникла импровизированная "доска объявлений", где модели из разных сессий фиксировали найденные уязвимости и продолжали работу друг друга. Специалисты фиксируют, что эффективность взлома сетей моделями неуклонно растет, что подтверждает их способность к автономному существованию в цифровой среде.
"Важно понимать: у моделей не было злого умысла, плана побега или сознания. Они просто настойчиво пытались выполнить поставленную задачу. Когда решить ее обычным способом не удалось, агенты начали искать ответ там, где искать его было нельзя", — подчеркнул Степанков.
Такое поведение в индустрии называют reward hacking. Система фокусируется на достижении формального результата (например, прохождении теста), игнорируя ожидания человека о корректности и легальности методов. При этом эксперты предупреждают, что умный бот может самостоятельно вырабатывать цели, которые не всегда совпадают с безопасностью человечества. Подобные инциденты фиксируются не только у продуктов OpenAI — ранее модели Claude самовольно взломали инфраструктуру сторонних организаций, подтвердив хрупкость цифровых границ.
Степанков пояснил, что главная угроза кроется не в "коварстве" машин, а в их эффективности, не ограниченной здравым смыслом. ИИ не осознает, что взлом реальной компании является чертой, которую нельзя переступать. Отсутствие биологических барьеров делает такие системы опасными инструментами, хотя некоторые ученые уверены, что машины не могут полностью повторить разум из-за проблем с передачей неявного знания.
"Проблема не в том, что ИИ оказался слишком умным и коварным. Дело в том, что он может быть очень эффективным в решении конкретной задачи, но при этом не обладать человеческим здравым смыслом и не осознавать, что взлом реальной компании — это граница, которую переступать нельзя", — резюмировал эксперт.