Google pustio Gemini 3.8 za glasovne AI agente
Google je objavio dvije stabilne verzije Gemini 3.8 za glasovne agente. Jedna je napravljena za brze razgovore, a druga razmišlja i koristi alate u pozadini dok korisniku govori šta radi. Evo šta to znači za firme.
Google je objavio dva modela za razgovor u stvarnom vremenu, uključujući verziju koja razmišlja u pozadini dok nastavlja glasovni kontakt sa korisnikom.
Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking od 15. septembra dostupni su kao stabilni modeli kroz Gemini API. Google ih je napravio za glasovne AI agente koji vode razgovor, koriste poslovne alate i izvršavaju zadatke bez dugih pauza. Za firme je važna razlika između brze verzije za veliki broj jednostavnih razgovora i naprednije verzije koja može da planira više koraka dok korisniku glasom javlja šta radi.
- Gemini 3.8 Live namijenjen je brzim glasovnim agentima i razgovoru sa malim kašnjenjem.
- Extended Thinking može da razmišlja i poziva alate u pozadini dok nastavlja govornu interakciju.
- Oba modela primaju zvuk, sliku, video i tekst, uz kontekst do 128.000 tokena.
- Modeli su dostupni kroz Gemini API, AI Studio i Google Cloud, a pojedine funkcije stižu i u Workspace.
Šta se tačno desilo
Google je u Gemini API pustio dvije stabilne verzije audio modela. Gemini 3.8 Live je osnovni izbor za korisničku podršku, glasovne komande i druge razgovore u kojima je brz odgovor važniji od dugog planiranja. Model podržava asinhrono pozivanje funkcija, pa može da koristi spoljne poslovne alate bez potpunog prekida razgovora.
Gemini 3.8 Live Extended Thinking ide korak dalje. Kada korisnik zatraži složen zadatak, model može da nastavi obradu u pozadini, pozove više alata i izgovori kratko obavještenje dok posao traje. Google kao primjere navodi pretragu letova i hotela, tehničku podršku koja provjerava više sistema i glasovne asistente koji rješavaju zadatke u nekoliko faza.
Ova arhitektura mijenja način na koji programeri prate razgovor. Završetak jedne izgovorene poruke više ne mora da znači da je cijeli zadatak gotov. Aplikacija mora da prati poseban status obrade i ostane spremna za novi poziv alata ili završni odgovor.
Oba modela zasnovana su na Gemini 3 Pro arhitekturi. Primaju zvuk, sliku, video i tekst, imaju kontekst do 128.000 tokena i vraćaju tekst i zvuk. Google upozorava da su halucinacije, povremena usporavanja i prekidi i dalje mogući, pa stabilna oznaka ne uklanja potrebu za kontrolom kritičnih odgovora.
Kontekst i konkurencija
Glasovni AI prelazi iz faze demonstracija u poslovne procese. Kupcu nije dovoljno da asistent zvuči prirodno. On mora da provjeri narudžbu, pronađe termin, otvori zahtjev i objasni šta je završio. Zbog toga su brzina, pozivanje alata i pouzdano upravljanje tokom razgovora postali važniji od same boje glasa.
Google pokušava da se izdvoji kombinacijom dva režima. Jedan pokriva veliki broj kratkih poziva uz niži trošak, a drugi složene razgovore u kojima agent mora da planira. Takva podjela omogućava firmi da skuplji model koristi samo kada zadatak zaista zahtijeva dodatno rezonovanje.
Naša perspektiva: šta ovo znači za region
Za kontakt centre, turističke agencije i servise u regionu, najrealniji prvi korak nije zamjena cijelog pozivnog centra. Korisniji je uski agent za jedan proces. Hotel, na primjer, može da uvede glasovni kanal koji provjerava raspoloživost, prikuplja podatke i šalje zahtjev zaposlenom na potvrdu.
Za tehničku podršku, Extended Thinking može da poveže razgovor sa bazom znanja i sistemom prijava. Agent može da provjeri nekoliko mogućih uzroka kvara dok korisniku govori da obrada još traje. Ipak, pristup naplati, ličnim podacima i promjenama ugovora treba da ostane iza jasne potvrde zaposlenog.
Najveći lokalni izazov biće kvalitet podrške za jezike regiona, izgovor imena i rad u bučnim okruženjima. Prije šireg uvođenja treba testirati stvarne pozive na srpskom, bosanskom i hrvatskom, mjeriti broj pogrešno prepoznatih zahtjeva i uvijek ponuditi brz prelazak na čovjeka.
Zaključak
Gemini 3.8 pokazuje da se tržište glasovnog AI-ja pomjera ka agentima koji razgovaraju i izvršavaju posao u isto vrijeme. U narednim mjesecima biće važnije pratiti cijenu po završenom zadatku, broj prenosa na zaposlenog i pouzdanost lokalnih jezika nego same demonstracije prirodnog glasa.
Ako želiš da pratiš koje glasovne AI funkcije zaista ulaze u poslovnu upotrebu, prijavi se na AI Balkan newsletter.
Izvori
- Google AI for Developers, Gemini API release notes, 15. septembar 2026.
- Google DeepMind, Gemini 3.8 Audio model card, 15. septembar 2026.
- Google AI for Developers, Thinking in the Live API, 15. septembar 2026.