Fable 5.1 знищила конкурентів у сліпому тесті, а DeepSeek просто злився
Сім топових нейромереж зійшлися у восьми жорстких практичних завданнях. Це не просто сухі цифри, а справжня перевірка на те, чи справді ваші улюблені AI-боти розумні, чи вони просто гарно роздуті маркетинговим бюджетом.
В рамках відкритого тестування сім моделей змагалися у створенні сайтів, 3D-роботів та міні-ігор. Судді не бачили назв моделей, оцінюючи лише кінцевий результат, тому Fable 5.1 впевнено вирвалася на перше місце. Друге місце посіла Kimi K3, а GPT-5.6 Sol замкнула трійку лідерів.
Найцікавіше сталося під час логічних задач та «турніру мурах». Gemini 3.8 Flash виявилася єдиною моделлю, що змогла розгадати складну загадку, поки DeepSeek V4 Pro витратив цілий статок на токени, але так і не зміг дати відповідь. У мурашиному турнірі Fable 5.1 єдина здогадалася атакувати чужі мурашники, тоді як інші моделі просто нудно спостерігали за своїми втратами.
Примітно, що після оновлень GPT-5.6 Sol почала грати гірше, ніж на старті. Це наочний доказ того, що розробники часто псують код у спробах зробити його «розумнішим». Вся правда про продуктивність, ціну за бал та логічні провали моделей зараз висить у відкритому доступі для всіх охочих порівняти результати.
Цей тест показує всю абсурдність нинішньої AI-гонки, де корпорації вимірюють успіх грошима, а не реальними вміннями. Схоже, що найдорожчий AI — це не завжди найрозумніший, а просто найуспішніший інструмент для викачування грошей з інвесторів.
Джерело: ikorg.ru
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.