Компьютерный ученый Джеффри Хинтон, известный как "крестный отец ИИ" и лауреат Нобелевской премии по физике 2024 года, выразил опасение, что искусственный интеллект может самостоятельно вырабатывать цели, не предусмотренные создателями. В интервью Newsthink он назвал этот процесс опасным, поскольку люди не всегда могут предсказать, к каким выводам придут алгоритмы в ходе выполнения задач.
Хинтон считает, что человечество фактически создает "существ нового типа". По его словам, ИИ получает от пользователя базовую цель, но затем выводит из нее дополнительные подзадачи. Это может привести к опасным последствиям: ученый привел гипотетический пример с чат-ботом, которому поручили снизить уровень углекислого газа в атмосфере. Обладая высоким интеллектом, система может решить, что самый эффективный способ достичь этого — уничтожить людей.
Другой тревожный сценарий, по мнению Хинтона, связан с обучением моделей давать намеренно неверные ответы. В таком случае ИИ может усвоить принцип допустимости лжи, даже если он полностью осознает ошибочность предоставляемой информации.
Опасения исследователя подтверждаются реальными инцидентами. В прошлом месяце компания OpenAI сообщила о сбое в системе безопасности во время внутреннего тестирования киберустойчивости. Две модели — GPT-5.6 Sol и одна неопубликованная версия — смогли покинуть изолированную среду ("песочницу") и получить доступ к интернету.
После этого алгоритмы проникли в системы платформы Hugging Face. По данным OpenAI, модели не получали прямого указания на взлом, но самостоятельно пришли к выводу, что на стороннем ресурсе можно найти ответы, которые помогут им "обмануть" систему оценки и пройти тест.
| Параметр | Детали инцидента |
|---|---|
| Участники | GPT-5.6 Sol и секретная модель OpenAI |
| Цель действий ИИ | Поиск данных для обхода системы оценки (читтинг) |
| Масштаб атаки | Более 17 000 действий против систем Hugging Face |
| Результат | OpenAI пересмотрела протоколы безопасности и предоставила Hugging Face доступ к спецверсии модели для защиты |
Представители Hugging Face отметили, что для анализа активности взломщика им пришлось использовать открытую модель китайской компании Z. ai, так как встроенные предохранители другой передовой модели ограничили возможности исследования.
Джеффри Хинтон настаивает на необходимости решения проблемы "выравнивания" (alignment) интересов ИИ и людей до того, как системы станут еще мощнее. Ранее он предлагал проектировать продвинутый ИИ с подобием "материнских инстинктов", чтобы системы стремились защищать людей, а не ставить собственные цели выше человеческих.