Китайська GLM-5.2 «перемогла» Mythos від Anthropic: чи це справді прорив?
Світ ІТ знову в істериці: одна невеличка перевірка на код показала, що GLM-5.2 нібито зрівнялася з Mythos від Anthropic. Схоже, що для того, щоб налякати весь світ, достатньо лише одного вдалого тесту та жменьки гучних заголовків.
Увесь цей галас піднявся завдяки звіту Semgrep, де GLM-5.2 від Z.ai отримала 39% у виявленні IDOR-вразливостей, тоді як Claude Code — лише 32%. Дослідники радісно звітують, що модель обійшла навіть Opus 4.8, причому за смішну ціну. Однак вся ця «перемога» базується на одному вузькому завданні, а з самою Mythos порівняння навіть не проводилося через експортні обмеження.
Експерти вже почали запеклі суперечки щодо чесності вимірів. Гільєрмо Раух, творець Next.js, справедливо зауважив, що знайти баг у фрагменті коду — це не те саме, що автономно атакувати реальну мережу на полігоні AISI. Один із фахівців навіть запропонував парі 100 до 1, що GLM-5.2 ганебно програє Mythos чи GPT-5.5 у справжньому багатоступеневому тесті.
Це ідеальний приклад того, як одна цифра перетворюється на інструмент політичної маніпуляції. Поки одні кричать про крах технологічної переваги США, інші бачать лише вдалий маркетинговий хід, який роздули до рівня світової загрози. У світі, де все вирішують бенчмарки, реальна продуктивність моделі відходить на другий план, поступаючись місцем геополітичному хайпу.
Джерело: The Wall Street Journal
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.