Google випустила Gemini 3.8: нарешті голос, що не тупить, або черговий дорогий іграшковий бот?
Google презентувала Gemini 3.8 Live з функцією «роздумів» у реальному часі. Технологія вражає прямою обробкою звуку без посередників, але поки що бот виглядає як геній, що не вміє користуватися банківською карткою.
Google представила нові нативні speech-to-speech моделі: Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking. Забудьте про старі «костури», де окремі сервіси розпізнавали мову, обробляли її та синтезували відповідь, створюючи нескінченні затримки. Новинка працює з аудіо напряму, зберігаючи інтонації та емоції.
Найкорисніше оновлення — асинхронний виклик функцій. Тепер бот не «зависає» у тиші, поки звертається до API, а продовжує розмовляти з користувачем, озвучуючи прогрес виконання завдання. Система підтримує 97 мов із перемиканням на ходу та маркує аудіо водяним знаком SynthID, бо корпораціям дуже хочеться знати, що ви слухаєте їхній AI.
Попри круті цифри у бенчмарках, у банківських сценаріях Extended Thinking показує успіх лише у 35,1% випадків. Це чудовий результат, якщо ви хочете пограти у лотерею зі своїми грошима, але досить сумнівний для реального бізнесу, що працює з Salesforce чи ServiceNow. Жодних варіантів для self-hosting, лише хмарні сервіси Google.
Вартість роботи моделі виходить у рази дешевше за годину роботи живого оператора. Проте відсутність можливості розгорнути це на власному сервері робить Gemini недоступним для медицини та держсектору, де конфіденційність важливіша за дешеві токени. Дешево — це добре, але коли AI помиляється у третині випадків при переказі коштів, ціна помилки стає вищою за будь-яку економію.
Джерело: MarkTechPost
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.