Дебаг-тест Claude Fable 5 обвалився з 86 до 26 балів через параноїдальні фільтри
Ніщо так яскраво не демонструє тріумфальне повернення технологій майбутнього, як нейромережа, яка настільки сильно боїться власної тіні, що відмовляється виправляти ваші баги. Зустрічайте оновлений та максимально заляканий шедевр від компанії Anthropic.
Команда BridgeMind вирішила перетестувати повернуту після блокування модель Claude Fable 5 на власному бенчмарку BridgeBench, і результати виявилися відверто катастрофічними — можливості AI в написанні коду пробили дно.
Поки раніше модель впевнено трималася серед лідерів інструментів для розробників, свіжий запуск показав падіння ефективності рефакторингу майже вдвічі, а стійкість до галюцинацій під час аналізу коду суттєво знизилася. Автори бенчмарку одразу ж висунули претензії до компанії Anthropic, заявивши, що ця версія нейромережі кардинально відрізняється від того потужного інструменту, який тимчасово забанили у червні.
Головним винуватцем цього цифрового регресу виявився не раптовий дефіцит штучного інтелекту, а гіперактивний цифровий нянь. Нові фільтри безпеки, розроблені після консультацій із урядом США, блокують звичайні запити розробників та непомітно перенаправляють їх на значно слабшу модель Claude Opus 4.8. Розробники з Anthropic чесно попереджали про надмірну чутливість нового класифікатора кібербезпеки на перших етапах, але ніхто не очікував, що система вважатиме звичайний цикл у коді загрозою національного масштабу.
Обурені користувачі вже заповнюють форуми скаргами на те, що купуючи преміум-доступ заради передової Fable 5, вони змушені отримувати відповіді від застарілої Opus 4.8. Ситуацію погіршує те, що заблоковані запити все одно списують ліміти використання, змушуючи розробників платити гроші за задоволення бути цензурованими переляканим алгоритмом.
Щоправда, до самого дослідження є чимало запитань, адже автори бенчмарку з BridgeMind більше відомі своїми вірусними постами про "вайб-кодинг", ніж серйозною науковою роботою. Минулий скандал за участю дослідника на ім'я Пол Калкрафт довів, що ця команда вже маніпулювала тестовими даними заради хайпу, та й нинішній тест проводили через сторонній агрегатор, а не напряму. Втім, навіть з урахуванням цих нюансів, і скарги користувачів, і заяви самої Anthropic підтверджують сумний факт — модель повернулася у важких регуляторних кайданах.
Технологічні гіганти продовжують продавати казки про AI-програмістів, які замінять людей, паралельно створюючи фільтри безпеки, що бачать у звичайному HTML загрозу тероризму. Схоже, ідеальний безпечний штучний інтелект у розумінні корпорацій — це той, який просто мовчить.
Джерело: X
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.