Gemini 3.6 Flash je jeftiniji i troši 17 odsto manje tokena
Google je predstavio Gemini 3.6 Flash i dva prateća modela. Za firme priča nije u novim funkcijama nego u cijeni, novi Flash troši 17 odsto manje tokena i obara efektivnu cijenu po zadatku i do 71 odsto na kodiranju. Šta to znači za tvoj mjesečni račun za AI.
Google je predstavio tri nova Flash modela, a najveća promjena za firme nije brzina nego niža cijena po zadatku.
Google je 21. jula predstavio Gemini 3.6 Flash, novu verziju svog brzog i jeftinog AI modela, zajedno sa modelima Gemini 3.5 Flash-Lite i 3.5 Flash Cyber. Za firme koje već grade nešto na Gemini API-ju, ili tek biraju model, glavna vijest nije nova funkcija nego cijena. Gemini 3.6 Flash troši 17 odsto manje izlaznih tokena od prethodnika i košta niže po zadatku, a to se direktno vidi na mjesečnom računu za AI.
- Gemini 3.6 Flash košta 1,50 dolara za milion ulaznih i 7,50 dolara za milion izlaznih tokena, umjesto ranijih 9 dolara za izlazne.
- Model troši 17 odsto manje izlaznih tokena, pa efektivna cijena po završenom zadatku pada oko 31 odsto, a na agentskim zadacima kodiranja i do 71 odsto.
- Uz njega stižu Gemini 3.5 Flash-Lite, po cijeni od 0,30 i 2,50 dolara za milion tokena, za brze zadatke velikog obima, i 3.5 Flash Cyber za pronalaženje sigurnosnih propusta.
- Baza znanja modela pomjerena je sa januara 2025. na mart 2026, pa model radi sa svježijim informacijama.
- Gemini 3.5 Pro se još testira sa partnerima, a Google je počeo pretreniranje modela Gemini 4.
Šta je Google tačno predstavio
Google je objavio tri modela iz Flash porodice, one jeftinije i brže od vrhunskih Pro modela. Glavni je Gemini 3.6 Flash. U odnosu na prethodni 3.5 Flash, troši 17 odsto manje izlaznih tokena i završava zadatke sa manje koraka razmišljanja i manje poziva alatima. Cijena mu je 1,50 dolara za milion ulaznih i 7,50 dolara za milion izlaznih tokena, umjesto ranijih 9 dolara za izlazne. Na testovima kodiranja bilježi napredak, na DeepSWE mjeri 49 odsto naspram ranijih 37, a baza znanja mu ide do marta 2026.
Drugi model, Gemini 3.5 Flash-Lite, namijenjen je zadacima velikog obima gdje su bitne brzina i niska cijena, kao što su pretraga i obrada dokumenata. On košta 0,30 dolara za milion ulaznih i 2,50 dolara za milion izlaznih tokena. Treći, Gemini 3.5 Flash Cyber, služi za pronalaženje i krpljenje sigurnosnih propusta u kodu i za sada je dostupan samo vladama i provjerenim partnerima u ograničenom pilotu. Modeli su dostupni u Gemini aplikaciji, a programeri im pristupaju preko alata Google Antigravity, AI Studio i Android Studio.
Zašto je cijena važnija od brzine
Token je komad teksta koji model obrađuje, otprilike jedna riječ ili dio riječi. Svaki upit i svaki odgovor se naplaćuju po broju tokena. Kad model za isti posao potroši manje tokena, isti zadatak košta manje, bez obzira na cijenu po tokenu. Zato Google naglašava da efektivna cijena po završenom zadatku pada oko 31 odsto, a na složenijim agentskim zadacima kodiranja i do 71 odsto.
Za firmu koja AI koristi povremeno, ova razlika je sitna. Ali za firmu koja kroz model gura hiljade upita dnevno, u alatu za podršku, obradi dokumenata ili automatizaciji, ušteda se gomila iz mjeseca u mjesec. Tu se odluka o modelu pretvara u stavku u budžetu.
Kontekst i konkurencija
Google ovim potezom ne juri rekord na testovima, nego cijenu. Dok se OpenAI, Anthropic i Google nadmeću vrhunskim modelima, prava bitka za svakodnevne poslovne zadatke vodi se u jeftinijem sloju, gdje pritisak dodatno prave kineski otvoreni modeli koji obaraju cijenu. Google svoj Flash sloj gura upravo tu.
U isto vrijeme, njihov najjači model, Gemini 3.5 Pro, još nije široko dostupan i testira se sa partnerima, dok je tim DeepMind već počeo pretreniranje sljedeće generacije, modela Gemini 4. Drugim riječima, Google popravlja jeftini kraj ponude dok se vrh još kuva.
Naša perspektiva, šta ovo znači za region
Za softverske firme i agencije u regionu koje grade proizvode na AI-ju, ovo je konkretna ušteda. Firma koja kroz Gemini gura obradu ugovora, računa ili korisničkih upita može preći na 3.6 Flash ili još jeftiniji Flash-Lite i oboriti mjesečni račun za AI, bez pada kvaliteta na rutinskim zadacima. Primjer, mala firma koja mjesečno plaća nekoliko stotina dolara za AI u svom alatu istim budžetom može da obradi znatno veći obim posla.
Za one koji AI ne grade nego ga samo koriste kroz gotove alate, efekat dolazi posredno. Jeftiniji modeli u pozadini znače jeftinije ili izdašnije AI funkcije u alatima koje već plaćaju. Vrijedi provjeriti da li tvoj alat nudi izbor modela, jer prelazak na Flash-Lite za jednostavne zadatke može značiti manji račun za isti posao.
Zaključak
Rat cijenama u AI-ju se nastavlja, a jeftini Flash sloj je mjesto gdje odlazi najveći obim posla. Vrijedi pratiti kako će OpenAI i Anthropic odgovoriti na cijenu i kada će Gemini 3.5 Pro postati široko dostupan. Za firme je poruka jednostavna, prije nego što izabereš model, izračunaj cijenu po zadatku, ne samo cijenu po tokenu.
Ako želiš da svake sedmice dobiješ AI vijesti prevedene na to šta konkretno znače za tvoj posao i tvoj budžet, prijavi se na AI Balkan newsletter.
Izvori
9to5Google (21. jul 2026): https://9to5google.com/2026/07/21/gemini-3-6-flash-launch/
Google blog (21. jul 2026): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
MarkTechPost (21. jul 2026): https://www.marktechpost.com/2026/07/21/google-releases-gemini-3-6-flash-3-5-flash-lite-and-3-5-flash-cyber-a-cheaper-more-token-efficient-flash-tier-built-for-agentic-workloads/