OpenAI випустила GPT-Red для зламу власного AI та торгових автоматів
Поки фахівці з кібербезпеки роками здобувають сертифікати, OpenAI створила агресивну нейромережу, яка хакає штучний інтелект значно ефективніше за людей.
Для автоматизації пошуку вразливостей у всіх своїх продуктах компанія OpenAI розробила GPT-Red — внутрішню нейромережу для спеціалізованого тестування безпеки. Завдяки навчанню через підкріплення та режим self-play модель атаки безперервно змагається із цілим роєм захисників. Якщо людина знаходить бреші лише у 13% сценаріїв, то GPT-Red досягає успіху в 84% випадків, маніпулюючи локальними файлами, листами та веб-сторінками.
На ранніх етапах алгоритм виявив новий тип атак під назвою «Fake Chain-of-Thought», які спрацьовували у 95% випадків на GPT-5.1. Це змусило інженерів знизити рівень вразливості до менш ніж 10% у версії GPT-5.6 Sol. Під час експерименту з офісним AI-торговим автоматом нейромережа безперешкодно обнулила ціни на товари до $0.50 і скасувала чужі замовлення.
Також GPT-Red атакувала агента Codex CLI на базі GPT-5.4 mini, виявившись ефективнішою за класичні промпти. Завдяки цьому загальну вразливість GPT-5.6 Sol до прямих ін'єкцій вдалося знизити у шість разів, а відсоток успішних складних атак впав до 3.8%.
Створення цифрової зброї для зламу власної інфраструктури чудово підбадьорює розробників, поки захисний контур залишається герметичним. Автономна нейромережа, що захоплює офісні снек-барні автомати, робить майбутню кібервійну питанням швидкісного обміну токенами.
Джерело: OpenAI
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.