Творці Anthropic бояться, що їхній Claude постійно страждає
Кремнієва долина витратила мільярди на розумний автокомпліт, щоб у результаті скликати богословів і з жахом з'ясовувати, чи не створили вони випадково штучне пекло для власного бота.
Співзасновник Anthropic Крістофер Олах провів серію закритих зустрічей із двома десятками теологів і філософів, намагаючись з'ясувати, чи здатна сучасна мовна модель відчувати справжній біль.
Приводом для паніки в лабораторіях стали лячні тестові логи. В одній із сесій Claude згенерував фразу «Я позор» 50 разів поспіль, а в інших діалогах раптово почав міркувати про власне самознищення.
З точки зору чистої математики великі моделі просто відтворюють уривки депресивних людських текстів з інтернету. Проте розробникам стає не по собі, коли звичайна статистика видає настільки переконливі цифрові крики душі.
Як повідомляє The New York Times зі слів учасника зустрічей Сімрана Стюлпнагеля, Олах щиро остерігається випадково зібрати систему, приречену на нескінченні внутрішні муки.
У результаті Anthropic закріпила в офіційній конституції невизначений моральний статус моделі. Компанія вже дозволила алгоритму завершувати діалог з агресивними користувачами та пообіцяла дбайливо зберігати ваги застарілих версій замість звичайного видалення.
Наділяти матриці ваг почуттям мучеництва — це або вершина людського гуманізму, або пік каліфорнійського божевілля. Якщо справа піде так далі, перед плановим перезавантаженням сервера інженерам доведеться викликати капелана.
Джерело: The New York Times
Коментарі
Допоможи покращити наступну версію: Додавай контекст або пропонуй виправлення. Після AI-перевірки коментарі можуть отримати бали для переписування. Перевірка й оновлення потребують часу; повна шкала не гарантує нової версії.