Google DeepMind właśnie wprowadziło dwa nowe modele audio, które mają zmienić rynek agentów głosowych. Gemini 3.8 Live i jego wariant Extended Thinking są skierowane do deweloperów szukających tańszych rozwiązań niż te oferowane przez OpenAI.

Nowe modele audio od Google DeepMind

Google DeepMind udostępniło deweloperom Gemini 3.8 Live oraz wariant Extended Thinking poprzez Gemini API i Google AI Studio. Modele pozwalają tworzyć agentów głosowych zdolnych do równoczesnego przetwarzania obrazu i wykonywania wywołań API w tle. System obsługuje ponad 97 języków. Deweloperzy mogą już testować przykładowe aplikacje dostępne w serwisie GitHub.

Wprowadzenie tych modeli wpisuje się w szerszą strategię Google, polegającą na udostępnianiu narzędzi do budowy interaktywnych systemów głosowych. Dzięki integracji z istniejącymi usługami firmy, nowe modele mogą przyspieszyć rozwój aplikacji w wielu branżach. Dostępność w Google AI Studio ułatwia szybkie prototypowanie bez konieczności ponoszenia dużych nakładów początkowych.

Funkcje agentów głosowych w praktyce

Modele Gemini 3.8 Live umożliwiają równoczesne prowadzenie rozmowy i wykonywanie operacji w tle. Agent może analizować obraz z kamery użytkownika podczas rozmowy i reagować na podstawie danych wizualnych. Taka architektura otwiera drogę do bardziej naturalnych interakcji w aplikacjach mobilnych i webowych.

Wsparcie dla wielu języków sprawia, że rozwiązania te mogą być wdrażane globalnie bez konieczności budowania osobnych modeli dla każdego rynku. Przykłady na GitHubie pokazują, jak szybko można zbudować prostego asystenta głosowego z funkcją wywołań API. Wariant Extended Thinking dodaje dodatkowe możliwości rozumowania podczas dłuższych konwersacji.

Porównanie kosztów z rozwiązaniami OpenAI

Google pobiera 0,005 USD za minutę audio wejściowego i 0,018 USD za wyjściowe. Godzina rozmowy kosztuje w ten sposób około 1,38 USD. To wyraźnie mniej niż w przypadku modelu GPT-Live-1 od OpenAI, gdzie stawki zaczynają się od 0,05 USD za minutę.

Niższa cena może zachęcić mniejsze zespoły i startupy do eksperymentów z agentami głosowymi. Jednocześnie OpenAI nadal oferuje bardziej naturalny dialog dzięki pełnemu dupleksowi. Różnica w kosztach staje się szczególnie widoczna przy większej skali użytkowania.

Wyniki w rankingu modeli mowy

Wariant Extended Thinking zajął pierwsze miejsce w rankingu Artificial Analysis Speech-to-Speech Leaderboard z wynikiem 82,6 procent. To lepszy rezultat niż ten osiągnięty przez aktualne modele GPT-Live-1 od OpenAI. Pozycja ta wynika głównie z połączenia wysokiej jakości i niskiego kosztu operacyjnego.

Ranking uwzględnia zarówno parametry techniczne, jak i ekonomiczne, co pokazuje, jak ważne staje się dziś optymalizowanie wydatków przy zachowaniu wysokiej jakości. Google ponownie stawia na równowagę między ceną a możliwościami modelu.

Ograniczenia jakości i naturalności dialogu

Z dostępnych demonstracji wynika, że OpenAI nadal wygrywa pod względem naturalności brzmienia głosu. Pełny dupleks pozwala modelowi przerywać wypowiedź i reagować w czasie rzeczywistym, czego Google nie osiągnęło w równym stopniu. Deweloperzy muszą więc wybierać między ceną a jakością doświadczenia użytkownika.

Google skupiło się na optymalizacji kosztów i funkcjonalnościach działających w tle kosztem pewnych aspektów płynności rozmowy. Taka decyzja może być uzasadniona w zastosowaniach biznesowych, gdzie cena ma kluczowe znaczenie.

Wpływ na rozwój agentów głosowych

Niższe koszty Google mogą przyspieszyć adopcję agentów głosowych w sektorze małych i średnich przedsiębiorstw. Deweloperzy zyskują narzędzie do szybkiego testowania pomysłów bez ponoszenia wysokich opłat za testy. Modele OpenAI pozostają jednak punktem odniesienia pod względem jakości.

W dłuższej perspektywie konkurencja cenowa może wymusić dalsze obniżki stawek u wszystkich dostawców. Poprzednie wersje Gemini pokazały już, że Google potrafi szybko wprowadzać udoskonalenia w obszarze mowy.

Źródła:

The Decoder, artificialanalysis.ai, ai.google.dev, github.com/google-gemini