Anthropic випустила Claude Sonnet 5.5: флагман Opus більше не потрібен?
Середній клас розгромив дорогі топи: нова модель обганяє власний флагман за половину вартості, але бухгалтерія ризикує посивіти через хитрий повзунок налаштувань.
Компанія Anthropic презентувала Claude Sonnet 5.5, зберігши базовий тариф на рівні двох доларів за мільйон вхідних і десяти доларів за мільйон вихідних токенів. Це вдвічі дешевше за розцінки флагманської Opus 5.5 за умови обіцяного прискорення обробки на 30%.
У практичних агентських завданнях баланс сил змістився не на користь дорожчого гіганта: на бенчмарку консольного кодингу Terminal-Bench 4.0 новинка показала 70,6% точності проти 66,4% у Opus 5.5. Незалежний індекс інтелекту від лабораторії Artificial Analysis віддав моделі друге місце у світі з 56 балами, посунувши GPT-6 Astra від OpenAI на третю сходинку.
Фінансовий нюанс спливає одразу після переводу системи в екстремальний режим. Під час максимальних зусиль Sonnet 5.5 спалює близько 193 000 вихідних токенів на одну задачу, піднімаючи вартість виконання до 7,60 долара — на половину дорожче за стару версію. Реальна економія відчувається виключно на помірних конфігураціях, тоді як максимальний режим купує останні відсотки якості за нечувані гроші.
Загальна ерудиція новинки помітно поступається флагманам: на тесті фактичних знань AA-Omniscience модель здобула лише 54% проти 66% у Opus 5.5. Натомість розробники вперше інтегрували повноцінний кіберзахист проти дистиляції, який блокує перехоплення внутрішніх ланцюжків міркувань конкуруючими компаніями.
Провідні наддорогі моделі стрімко перетворюються на музейні експонати для вузьких завдань, поки робочі конячки забирають собі реальну рутину. Головним талантом інженерів найближчим часом стане не вигадування промптів, а вміння вчасно скрутити повзунок старанності моделі, поки серверні рахунки не перевищили річний бюджет.
Джерело: Anthropic
Коментарі
Допоможи покращити наступну версію: Додавай контекст або пропонуй виправлення. Після AI-перевірки коментарі можуть отримати бали для переписування. Перевірка й оновлення потребують часу; повна шкала не гарантує нової версії.