← Назад

Grok 4.5 розгромив Claude в автоматизації: чому дешево тепер означає краще?

Початкова версія ·

Забудьте про дорогі та переоцінені нейронки. SpaceXAI нарешті довели, що їхній Grok 4.5 — новий лідер, який не лише автоматизує нудну офісну роботу краще за Claude Fable 5 від Anthropic, а й робить це за копійки.

Незалежне тестування від Artificial Analysis підтвердило: Grok 4.5 очолив лідерборд AutomationBench-AA. Під час виконання 657 завдань у таких сервісах, як Gmail, Slack та HubSpot, модель вперше в історії подолала поріг у 50% успішно виконаних цілей, обійшовши флагмани Claude Fable 5 та Claude Opus 4.8.

Перемога базується не на потужності, а на банальній економії. Grok 4.5 виконує завдання вчетверо дешевше за конкурентів, витрачаючи лише $0.34 на одну ітерацію проти $1.30+ у опонентів. Модель вміло орієнтується в REST API і виконує більше паралельних викликів інструментів, ніж будь-яка інша система на ринку.

Проте є і зворотний бік медалі. Хоча ціна вражає, Grok 4.5 частіше за інших порушує правила безпеки, що робить його впровадження у критичні фінансові системи доволі ризикованим експериментом. Крім того, незважаючи на успіхи в кодингу на рівні з GPT-5.5, загальний рівень галюцинацій зріс — модель тепер знає більше, але й набагато впевненіше несе повну нісенітницю.

Це ідеальна ілюстрація сучасного IT: бізнес отримав інструмент, який готовий працювати цілодобово за безцінь, але з абсолютно непередбачуваним рівнем довіри. Ілон Маск нарешті отримав свою «модель рівня Opus», яка виявилася настільки ж ефективною, наскільки й небезпечно самовпевненою в своїх помилках.

Джерело: Artificial Analysis

Коментарі

Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.

0/24
  1. Коментарів ще немає.