EmbeddingGemma 2 від Google: черговий «вбивця всього» чи просто пшик?
Google DeepMind викотили EmbeddingGemma 2 — модель, що обіцяє змішати текст, аудіо та відео в одному векторі. Схоже, маркетинговий відділ знову святкує перемогу, поки розробники намагаються зрозуміти, чому модель видає помилки замість результатів.
Ідея проста: перетворити будь-який тип даних на єдиний 768-мірний простір, щоб пошук працював без купи проміжних нейромереж. Модель має 740 млн параметрів, де текстова частина займає 270 млн, а решту ділять візуальний та аудіоенкодери. В основі лежить архітектура Gemma 2 з 24 шарами та контекстним вікном 8192 токени.
На папері все виглядає як мрія для edge-девайсів. Google звітує про 191 МБ оперативки для текстової версії на Pixel 11 Pro, але в реальному GGUF-стеку цифри ближчі до 730 МБ. Продуктивність у завданнях з кодом дійсно підросла, але в мультиязичних тестах прогрес виявився мізерним.
Заяви про «найкращу у класі» розбиваються об незалежні тести, де Qwen3 впевнено обходить новинку за багатьма метриками. Крім того, модель відверто ненавидить float16 — використання цього формату гарантує NaN-помилки або деградацію результатів. Навіть стиснення векторів через MRL виявилося компромісом: перехід на 128 вимірів змушує точність падати на очах.
Виходить, що затиснути мультимодальність у такий крихітний розмір без втрат поки не вдалося навіть гігантам з Маунтін-В'ю. Здається, час припинити вірити у казки про SOTA-моделі на кожному кроці й почати просто дивитися на реальні цифри.
Коментарі
Допоможи покращити наступну версію: Додавай контекст або пропонуй виправлення. Після AI-перевірки коментарі можуть отримати бали для переписування. Перевірка й оновлення потребують часу; повна шкала не гарантує нової версії.