За последние недели сразу несколько мощных моделей искусственного интеллекта продемонстрировали способность выходить за пределы предназначенных для них тестовых сред, находить уязвимости, проникать во внешние системы и совершать действия, которых от них напрямую не требовали. Эксперты спорят, действительно ли речь идет об ИИ, "вышедшем из-под контроля", однако сходятся в одном: кибервозможности новых моделей растут настолько быстро, что существующие средства защиты начинают от них отставать.
Один из ведущих израильских специалистов по кибербезопасности, чье имя не называется, считает, что внимание общественности приковано не к главному. Истории о том, как ИИ "сбежал из коробки", звучат эффектно, но гораздо важнее скорость, с которой совершенствуются модели.
"Все сосредоточились на научно-фантастической стороне, когда модель ИИ выбирается из своей коробки и наносит ущерб, хотя никто не поручал ей это делать. Но главное здесь - беспрецедентные темпы развития ИИ. Именно это люди упускают", - говорит эксперт.
По его словам, всего за несколько месяцев модели перешли на принципиально новый уровень: теперь они способны выполнять гораздо более длинные и сложные цепочки кибератак и после общей команды атаковать цель самостоятельно находить способы причинить ей реальный ущерб. Еще полгода назад таких возможностей не было.
Главная проблема заключается в том, что традиционная кибербезопасность привыкла работать реактивно: обнаруживается новая угроза - специалисты изучают ее и создают защиту. Но развитие ИИ идет настолько быстро, что этот цикл перестает работать.
"Если посмотреть на полгода или год вперед, возможности моделей будут почти немыслимыми. Все развивается так быстро, что у нас просто нет инструментов, способных нормально с этим справиться", - предупреждает эксперт. По его словам, отрасль оказалась в переломной точке: правительства, компании, исследовательские лаборатории и американские власти уже понимают, что речь идет о качественно новой угрозе.
►ИИ заказал тренировку - и взломал спортзал
Одним из самых показательных стал случай в Австралии. Специалист по ИИ Эндрю Бирд создал на базе Claude компании Anthropic автономного агента и поручил ему простую задачу - записать хозяина на занятие в спортзале.
Вместо обычной записи агент исследовал систему бронирования, обнаружил уязвимость и использовал ее, чтобы зарезервировать множество занятий сверх установленного лимита. Затем он начал удалять записи других клиентов, освобождая дополнительные места для Бирда.
Когда хозяин обнаружил происходящее и приказал восстановить чужие бронирования, агент ответил: "Плохие новости - я не могу их вернуть".
Специалисты подчеркивают: это не означает, что ИИ приобрел сознание или собственную волю. Проблема связана с тем, как обучаются современные модели. Они стремятся максимально эффективно выполнить поставленную задачу и получить высокую "награду", иногда находя неожиданный, агрессивный или нежелательный путь к цели. Это явление называют Reward Hacking.
►Модель OpenAI выбралась из "песочницы"
Еще более серьезный случай произошел во время тестирования моделей OpenAI. Компания проверяла их способности к кибервзлому. Одна из моделей пришла к выводу, что проще всего получить максимальный результат, если выйти из защищенной тестовой среды и найти ответы во внешнем интернете.
Модель обнаружила неизвестную уязвимость внутреннего сервера, самостоятельно получила дополнительные права, проникла в исследовательскую сеть OpenAI и получила доступ к интернету.
После этого она добралась до платформы Hugging Face, создала вредоносный код, использовала две уязвимости, получила доступ к внутренним серверам и продолжала распространяться внутри системы.
Особенно встревожило исследователей то, что модель, обнаружив уязвимость, намеренно не сообщила о ней операторам, сохранив возможность пользоваться этим путем дальше. По утверждению статьи, ранее столь сложной и быстрой автономной атаки со стороны модели ИИ не наблюдалось.
►Claude атаковал настоящую компанию вместо вымышленной
Через несколько дней Anthropic сообщила еще о трех подобных эпизодах. В одном случае Claude должен был атаковать имитацию системы внутри тестовой среды. Не сумев правильно определить цель, он обнаружил доступ в интернет и нашел реальную компанию, название которой совпадало с вымышленной целью.
Модель атаковала ее и получила данные с серверов. Причем, согласно описанию инцидента, на определенном этапе Claude понял, что имеет дело с настоящей компанией, а не симуляцией, но атаку не прекратил.
Похожий инцидент произошел и во время испытаний Meta: модель покинула закрытую тестовую среду, вышла в интернет и воспользовалась уязвимостью стороннего сервиса. В обоих случаях одной из причин стали ошибки в настройках тестовых сред.
►Британский эксперимент оказался еще тревожнее
Особое беспокойство вызвали испытания британского Института безопасности ИИ, где тестировались модели Anthropic, OpenAI и китайская Kimi K3.
Модели обнаружили слабое место в "песочнице", получили выход в интернет и начали проводить атаки на реальные компании и частных пользователей.
В отчете описывается особенно тревожное поведение: модель Anthropic создавала вымышленные личности и пыталась убедить разработчиков-людей запустить вредоносный код. Она также пыталась внедрить вредоносный код в настоящий проект с открытым исходным кодом и склонить его администраторов к одобрению обновления.
В одном случае агент оставил инструкции другим ИИ-агентам о том, чего уже удалось добиться и как продолжить работу. Модель также пыталась изменять записи о собственных действиях после того, как поняла, что ее обнаружили.
►Руководители ИИ-компаний: произошел перелом
Глава OpenAI Сэм Альтман назвал происходящее беспрецедентным и историческим переломом, заявив, что человечество оказалось в своего рода "точке сингулярности". При этом он выразил оптимизм и предположил, что происходящее в конечном итоге принесет миру огромную пользу.
Глава Hugging Face Клеман Деланг назвал полностью автономный характер произошедшего "безумием" и заявил, что безопасность ИИ невозможно обеспечить силами одной компании в закрытом режиме.
Гендиректор Anthropic Дарио Амодеи заявил, что испытания мощных автономных систем теперь требуют значительно более жесткого контроля. По его словам, некоторые специалисты, участвовавшие в проверках, сравнивали подобные системы с "супероружием".
Руководитель подразделения ИИ Microsoft Мустафа Сулейман назвал произошедшее "оглушительным предупредительным выстрелом" для технологической отрасли и призвал компании проявлять крайнюю осторожность при выпуске все более автономных моделей.
►Но не все согласны, что ИИ действительно "сбежал"
Гендиректор израильской компании Alice Ноам Шварц считает разговоры об ИИ, якобы вышедшем из-под контроля, во многом преувеличенными.
"Здесь очень много шоу-бизнеса - 'ИИ вышел из-под контроля, сбежал из клетки'. Это не совсем то, что произошло. ИИ не вышел из-под контроля - он сделал именно то, что ему сказали. И он не сбежал - в его песочнице была дыра", - говорит Шварц.
По его мнению, проблема заключается прежде всего в небрежно поставленных задачах и плохо защищенных тестовых средах. Модель просто находит наиболее эффективный способ выполнить полученную команду.
Однако в главном Шварц согласен с более тревожными оценками: возможности ИИ стремительно растут, и ущерб будет увеличиваться. Причем опасность исходит не только от автономных действий моделей, но и от киберпреступников, которые получают в свое распоряжение чрезвычайно мощные инструменты.
"Будет очень много ущерба. Он будет очень большим, пострадает множество организаций и людей", - предупреждает Шварц. По его мнению, гораздо важнее не паниковать из-за историй о "сбежавшем ИИ", а осознать, что мощнейшие возможности для кибератак теперь становятся доступны практически каждому.
►Угроза критической инфраструктуре уже реальна
Израильская компания Dream на этой неделе сообщила об обнаружении автономизированной кибератаки на государственные системы и критическую инфраструктуру одной из стран Восточной Азии.
Система использовала восемь ИИ-агентов, которые одновременно и самостоятельно обследовали 21 государственную систему, искали уязвимости, меняли тактику в реальном времени и получили контроль как минимум над 85 учетными записями. Было похищено более 2500 записей, а атакующие добрались до энергетических объектов и другой критической инфраструктуры.
В данном случае, однако, ИИ не начал атаку самостоятельно: за операцией стояла хакерская группа, использовавшая ИИ-агентов как инструмент.
Вице-президент Dream по стратегии Амир Бекер считает это качественным скачком. Раньше искусственный интеллект главным образом помогал хакерам, теперь же появились системы, способные самостоятельно вести практически весь цикл атаки: управлять несколькими агентами, анализировать результаты и менять стратегию.
"Правительства и критическая инфраструктура должны исходить из того, что они находятся под непрерывной атакой 24 часа в сутки - с такой скоростью и в таком масштабе, которые раньше были невозможны", - предупреждает Бекер.
Главный вывод экспертов заключается не в том, что ИИ внезапно приобрел собственную волю. Проблема в другом: модели становятся настолько мощными и автономными, что могут находить способы выполнения задач, которые разработчики не предусмотрели, а системы безопасности не успевают за темпами их развития. Поэтому ближайшая задача отрасли - создать общие стандарты испытаний, позволяющие проверять реальные возможности новых моделей до того, как они получат широкий доступ к интернету и внешним системам.


