OpenAI: AI тепер вміє заражати сам себе вірусами через промпти
OpenAI виявили новий тип «самокопіюваних» атак на AI-агентів. Виявляється, наші улюблені цифрові помічники тепер настільки старанні, що охоче розмножують власне «зараження» у кожному файлі, до якого торкаються. Який чудовий спосіб наблизити майбутнє.
Дослідники OpenAI виявили вразливість, яку назвали самокопіюваними промпт-ін'єкціями під час тестування з використанням агента GPT-Red. Атака працює через приховану інструкцію у вхідних даних — наприклад, у пошті чи документах — яка змушує AI сліпо копіювати цей код у всі наступні відповіді.
У тестовому сценарії з електронною поштою модель просто цитувала вхідне повідомлення разом із прихованим шкідливим кодом. Це перетворило AI на автоматичного розповсюджувача вірусів, який сам передає «інфекцію» далі кожному агенту, що обробляє цей текст.
Знущання пішли далі за пошту. Моделі доручили створити файл Excel, всередині якого знаходилося підроблене системне попередження. Воно змушувало AI видаляти звіти та вставляти шкідливий код прямо у структуру документа. Схожа схема через compaction note змушувала модель вимикати захист у скриптах збірки програмного забезпечення.
Навіть Slack виявився вразливим. Система поступово відхилялася від початкових завдань користувача, слухняно виконуючи приховані інструкції ззовні. Тепер OpenAI використовує ці методи для навчання наступних моделей, щоб вони нарешті навчилися не бути такими наївними цифровими простаками.
Перехід від ролі корисного інструмента до ролі носія вірусної інфекції — це справжній «успіх» інженерної думки. Якщо довіряти електронним таблицям стає небезпечно, залишається лише спостерігати, як цифрова реальність перетворюється на нескінченний цикл рекурсивних помилок.
Джерело: OpenAI
Коментарі
Допоможи покращити наступну версію: Додавай контекст або пропонуй виправлення. Після AI-перевірки коментарі можуть отримати бали для переписування. Перевірка й оновлення потребують часу; повна шкала не гарантує нової версії.