Google випустили Gemini 4 Argon: чому ці цифри виглядають підозріло?
Google викатили Gemini 4 Argon, який нібито знищує GPT-6 Astra та Claude Opus 5.5. Все виглядає дуже красиво, поки не почнеш порівнювати ці результати з реальними задачами, де модель чомусь починає гальмувати.
Google представили Gemini 4 Argon, модель, яку позиціонують як абсолютного лідера у програмуванні та кібербезпеці. Згідно з внутрішніми даними компанії, вона випередила GPT-6 Astra та Claude Opus 5.5 у більшості протестованих категорій.
Головний показник — 77,9% у тесті DeepSWE v1.1, що виглядає як впевнена перемога. Модель також демонструє кращі результати в автоматизації бізнес-процесів та роботі з довгим контекстом, що обіцяє золоті гори для корпоративних розробників.
Проте диявол ховається в деталях: у новіших тестах, таких як Terminal-Bench 4.0 та FrontierSWE v2, результат Argon виявився нижчим за конкурентів. Це викликає цілком логічні питання, чи не підганяли алгоритми спеціально під ті бенчмарки, у яких компанія хотіла показати перевагу.
Поки що спробувати Argon самостійно неможливо — модель доступна лише вузькому колу користувачів. Ціна стартує з $2 за мільйон вхідних токенів, але з часом тарифи зростуть у два рази. Доступ через Google AI Ultra поки що залишається закритою вечіркою.
Створення AI, який виграє всі тести, але губиться у реальному коді — це вже старий добрий корпоративний спорт. Випускати модель, яка блищить лише у "правильних" звітах, — це геніальний маркетинговий хід, щоб змусити інвесторів повірити у черговий прорив, поки реальні користувачі знову будуть латати діри в промптах.
Джерело: Google Blog
Коментарі
Допоможи покращити наступну версію: Додавай контекст або пропонуй виправлення. Після AI-перевірки коментарі можуть отримати бали для переписування. Перевірка й оновлення потребують часу; повна шкала не гарантує нової версії.