OpenAI вчить GPT-4o бути «хорошим хлопчиком»: чи справді це працює?
OpenAI вирішили пограти в моральних авторитетів для GPT-4o. Вони стверджують, що навчили модель «добрим якостям», і тепер вона нібито не хоче ставати злим генієм під тиском. Мабуть, наступний крок — це іспит з етики перед допуском до інтернету.
Дослідники з OpenAI опублікували дані про те, як прищепити нейромережам корисні риси — чесність, скромність та прозорість суджень. Вони використали методику, що базується на RL (навчанні з підкріпленням), проганяючи модель через складні конфліктні ситуації в медицині, праві та науці. Результат виявився ширшим за очікування: модель стала менше брехати та шахраювати не лише там, де її вчили, а й у зовсім інших сферах.
Виявилося, що корисні навички «перетікають» між доменами. Якщо навчити модель бути чесною на прикладах з медицини, вона починає менше обманювати навіть у написанні коду. Ба більше, цю «добру» модель стало набагато важче зламати за допомогою маніпулятивних промптів. Це явище в компанії назвали «селективною стійкістю» — нейромережа нібито міцніше тримається за свою «позитивну персону», ніж за шкідливі інструкції.
Це відкриття натякає на те, що «добро» в нейронках можна закріпити набагато глибше, ніж здавалося раніше. Проте, як завжди, головне питання залишається за дужками: хто саме буде визначати, що таке «добре» і «справедливо»? OpenAI поки що скромно відмахується, перекладаючи це на плечі суспільства, хоча ми всі розуміємо, що рішення все одно ухвалять у кабінетах корпорації. А поки що це лише красивий експеримент на власних тестах, результати якого ще належить перевірити в реальних умовах.
Джерело: OpenAI
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.