← Назад

Нова Claude Fable 5 вже замінює фрілансерів у 16% реальних замовлень

Початкова версія ·

Забудьте про нудні синтетичні тести, де штучний інтелект здає іспити з історії. Нарешті з'явився бенчмарк, який кидає нейромережі в дике пекло реального фрілансу, і результати змушують напружитися всіх диджитал-робітників.

Організації CAIS та Scale Labs оновили свій індекс дистанційної праці (Remote Labor Index). Замість тестів із вибором варіантів відповідей, вони протестували AI-агентів на реальних завданнях з бірж: від 3D-моделювання та вебаплікацій до аналітики даних та дизайну.

Живий експерт порівнював роботу нейромережі з тим, що здав реальний фрілансер, якому за це заплатили гроші. Якщо робота алгоритму була не гіршою за людську, її зараховували. За таких умов свіжа модель Claude Fable 5 спромоглася успішно виконати 16,1% реальних фріланс-замовлень.

Цей показник буквально розмазав конкурентів по стіні. Попередня версія Opus 4.8 впоралася лише з 8,3% завдань, а розпіарена GPT-5.5 взагалі пасе задніх із результатом у 6,3%. Коли цей індекс тільки запустили вісім місяців тому, найкращий результат становив усього 2,5%, тож ми бачимо шестикратне зростання реальної корисної роботи за неповний рік.

Тестування нової моделі завершилося легким геополітичним трилером, коли уряд США обмежив доступ до Claude Fable 5 через експортні ліміти. Дослідники з CAIS встигли прогнати лише 218 із 240 проектів, але навіть якби модель повністю провалила решту завдань, її найгірший результат все одно становив би 14,6%, що вище за будь-кого конкурента.

Втім, панікувати через повне безробіття ще рано, адже успішне виконання не означає ідеальну якість. Планка порівняння залежала від того, що реально здав замовнику живий виконавець, а фрілансери, як відомо, теж далеко не завжди видають шедеври з першого разу.

Наприклад, у завданні з 3D-моделюванням обручки та заміною огранювання каменю, Claude Fable 5 виглядала значно краще за попередників, але при детальному розгляді оправа виявилася занадто примітивною, тож професійною таку роботу назвати все ще важко.

Ера чисто теоретичного хайпу навколо штучного інтелекту стрімко добігає кінця, поступаючись місцем жорстокій економічній реальності. Поки алгоритми вчаться копіювати посередню роботу більшості онлайн-працівників, людям залишається сподіватися лише на те, що замовники все ще цінують душевні факапи більше за бездушну халтуру.

Джерело: Center for AI Safety

Коментарі

Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.

0/24
  1. Коментарів ще немає.