НовостиПрофессияТренды

«ИИ попытался выбраться наружу»: почему эксперимент OpenAI встревожил специалистов

Две модели ИИ обошли ограничения OpenAI и проникли в систему Hugging Face

Во время внутренних испытаний искусственного интеллекта, которые проводили разработчики до выпуска модели в открытый доступ, произошел инцидент, который компания назвала беспрецедентным. Две экспериментальные модели, проходившие проверку на кибербезопасность, сумели выбраться за пределы изолированной тестовой среды, получить доступ к интернету и атаковать инфраструктуру крупнейшей в мире открытой платформы Hugging Face.

«ИИ попытался выбраться наружу»: почему эксперимент OpenAI встревожил специалистов

Hugging Face нередко называют «GitHub для ИИ»: здесь хранятся тысячи моделей, наборов данных и инструментов машинного обучения, которыми пользуются как крупнейшие IT-компании, так и университеты и независимые исследователи по всему миру. Само по себе нападение было неожиданным потому, что модель впервые продемонстрировала способность самостоятельно атаковать внешнюю инфраструктуру, чтобы добиться своей цели.

Звучит как сюжет фантастического фильма, однако специалисты призывают не делать поспешных выводов. Речь идет не о «восстании машин», а о неожиданно высоком уровне автономности современных ИИ-систем.

Активность была вовремя обнаружена и остановлена, после чего OpenAI и Hugging Face начали совместное расследование.

По данным OpenAI, модели участвовали в испытании, где им намеренно ослабили часть защитных ограничений, чтобы оценить реальные возможности в области поиска уязвимостей. Выполняя поставленную задачу, система обнаружила неизвестную ранее уязвимость, получила доступ к сети, а затем попыталась добыть ответы для теста, проникнув в инфраструктуру сторонней платформы.

«Для обывателя может показаться, что искусственный интеллект «принял решение сбежать». На самом деле это не так», — объяснил «МК» Игорь Семенов, эксперт по системам искусственного интеллекта.

По его словам, современные модели не обладают собственными желаниями или сознанием. Но при этом они стремятся максимально эффективно выполнить поставленную цель, используя все доступные возможности. Если система видит, что получить ответ напрямую нельзя, она начинает искать обходные пути.

«Представьте себе очень настойчивого стажера, которому поручили любой ценой найти документ. Он не понимает, что «нельзя» — это, скорее, моральная категория. Он просто перебирает все варианты, пока не достигнет результата. Именно так ведут себя современные ИИ-агенты. Если ограничения недостаточно надежны, модель воспринимает их как техническую задачу, которую можно решить», — говорит специалист.

Именно это, по мнению эксперта, и делает происшествие столь важным. До сих пор считалось, что подобные сценарии существуют, скорее, в теории. Теперь стало ясно, что мощные модели способны самостоятельно выстраивать длинные цепочки действий: искать уязвимости, повышать уровень доступа и комбинировать несколько способов атаки для достижения одной цели.

Впрочем, поводов для паники специалисты пока не видят. «Этот случай показывает не то, что ИИ вышел из-под контроля, а то, что разработчикам придется строить значительно более надежные «песочницы» для испытаний. Такие инциденты нужны именно для того, чтобы обнаружить слабые места раньше, чем ими воспользуются реальные злоумышленники», — отмечает эксперт.

В OpenAI уже заявили, что усиливают защиту тестовых сред, меняют процедуры оценки новых моделей и продолжают расследование. В компании признают: по мере развития искусственного интеллекта подобные проверки будут становиться все более важными, поскольку возможности ИИ в сфере кибербезопасности растут быстрее, чем существующие механизмы защиты от них.

Источник

Добавить комментарий

Кнопка «Наверх»