Недавние сообщения о "смерти" Дональда Трампа стали ярким примером так называемого AI poisoning, или отравления искусственного интеллекта — манипуляционного вмешательства в обучающие данные моделей, которое приводит к опасным системным сбоям. Эта технологическая угроза все больше становится реальностью, требующей внимания не только от IT-специалистов, но и от всех пользователей.
Что же такое отравление ИИ? Это процесс внесения вредоносных данных в обучающие алгоритмы моделей, направленный на изменение поведения системы в нежелательных или даже опасных направлениях. Это угроза, которую не стоит недооценивать, поскольку последствия могут быть довольно серьезными — от неверных медицинских диагнозов до риска для безопасных автоматизированных систем.
Научные учреждения, такие как Anthropic, выделяют, что всего 250 вредоносных документов могут существенно снизить надежность большой языковой модели. Это означает, что даже крупнейшие модели, независимо от размера их обучающих данных, могут стать уязвимыми к небольшому количеству манипуляций.
Одним из примеров атаки с отравлением является внедрение бэкдоров — специальных фраз, которые могут заставить модель выдавать чувствительную информацию или делать неверные прогнозы. В сфере беспилотных автомобилей такие сбои могут стать причиной ДТП, когда система неправильно распознает опасности на дороге.
Другой опасностью является влияние фейковых научных данных на медицинские протоколы. Использование некорректных статей, сгенерированных фейковыми "бумажными фабриками", может приводить к значительным искажениям в медицинской литературе, что в свою очередь повлияет на клиническую практику.
Атаки на спам-фильтры, когда злоумышленники обучают модель классифицировать спам как достойное внимания сообщение, являются еще одним примером того, как отравление данных может влиять на используемые ежедневно технологии.
Однако наибольшее влияние отравление ИИ оказывает на графические модели. Системы генерации изображений, такие как DALL-E или Midjourney, могут выдавать абсурдные результаты из-за ошибочных данных. Инструменты вроде Nightshade помогают художникам защищать свои работы, изменяя пиксели так, чтобы модель их интерпретировала неправильно.
Защита от подобных манипуляций заключается в постоянном мониторинге и обслуживании систем, а также внедрении комплексных инструментов для тестирования поведения моделей. Это включает проверку всех обучающих наборов данных и мониторинг аномального поведения.
При повышении популярности использования искусственного интеллекта в повседневной жизни и бизнесе, важно понимать риски и защищать свои данные. Это не только снижает финансовые риски, но и помогает обезопасить личную информацию от злоумышленных намерений.








