Nezavisni test, GPT-6 Astra hvata više bagova, ali 2,5 puta skuplje
CodeRabbit je nezavisno testirao GPT-6 Astru na stvarnom kodu. Model hvata više grešaka od konkurencije, posebno kod bagova koji zavise od više fajlova, ali cijena je 2,5 puta veća od GPT-5.6 Sol. Pokazujemo kad se ta cijena isplati.
Alat za pregled koda CodeRabbit je prvi nezavisno izmjerio koliko je novi OpenAI model zaista bolji od konkurencije, i po koju cijenu.
Kad je OpenAI prošle sedmice predstavio GPT-6 Astra, tvrdio je da model bolje razumije veze između različitih dijelova koda. Kompanija CodeRabbit, koja pravi alat za automatski pregled koda, je 4. septembra objavila nezavisan test koji tu tvrdnju provjerava na stvarnim projektima, ne na marketinškim brojkama proizvođača. Rezultat, Astra zaista hvata više grešaka nego prethodni modeli, posebno kad greška zavisi od više fajlova odjednom, ali cijena tog poboljšanja nije mala.
- Astra je u ukupnom testu uhvatio 61,3 odsto označenih bagova, GPT-5.6 Sol 59,0 odsto, Claude Opus 5 50,2 odsto.
- Na težim, višefajlnim pregledima, Astra je bio 20 odsto bolji od Sol-a i 33 odsto bolji od Opus 5.
- Po objavljenim cijenama, isti zadatak sa Astrom košta oko 1,50 dolara, sa Sol-om 0,60, a sa jeftinijim Luna modelom samo 0,032 dolara.
- To je 2,5 puta skuplje od Sol-a i oko 47 puta skuplje od najjeftinijeg OpenAI modela za isti obim posla.
- Astra podržava rad bez čuvanja podataka za kvalifikovane API klijente, što je važno za firme koje šalju privatni kod na AI pregled.
Šta se tačno desilo
CodeRabbit je pustio nekoliko modela da pregledaju isti skup stvarnog koda sa unaprijed poznatim, označenim greškama, i mjerio koliko je svaki model tih grešaka stvarno prijavio kroz konkretan, upotrebljiv nalaz koji programer može odmah da iskoristi. Na cijelom skupu zadataka, uključujući i lakše provjere, razlika između Astre i Sol-a je skromnih 4 odsto. Ali kad se izdvoje samo teški slučajevi, gdje greška nastaje zbog interakcije koda iz više različitih fajlova, Astrina prednost naraste na 20 odsto u odnosu na Sol i 33 odsto u odnosu na Opus 5.
Cijena je druga strana priče. Za ilustrativni zadatak od 100.000 ulaznih i 10.000 izlaznih tokena, Astra košta oko 1,50 dolara po objavljenim tarifama, isto koliko i Anthropicov Claude Fable 5.1. Za poređenje, GPT-5.6 Sol isti zadatak košta 0,60 dolara, Terra 0,32, a najjeftiniji Luna model samo 0,032 dolara, skoro 50 puta manje od Astre.
Kontekst i konkurencija
Ovo je prvi nezavisan test koji stavlja Astru pored konkurencije na istom, kontrolisanom skupu koda, umjesto da se oslanja na brojke koje je OpenAI sam objavio uz lansiranje. CodeRabbit napominje da rezultat ne znači da je Astra bolja u svemu, model ne dominira apsolutno, njegova prednost je specifično jača u zadacima gdje su relevantne informacije razbacane po više izvora, tačno onoj vrsti posla gdje veći kontekst i dublje rezonovanje najviše doprinose.
Bitna razlika između proizvođača je i politika čuvanja podataka. OpenAI-jev Astra podržava potpuno brisanje podataka (zero data retention) za kvalifikovane API klijente odmah, dok Anthropicov Fable po pravilu čuva podatke 30 dana radi bezbjednosnog nadzora, a mogućnost brisanja podataka uvodi postepeno kroz novi program za velike klijente. Za firmu koja šalje privatni kod klijenata na AI pregled, ova razlika može biti jednako važna kao i sama tačnost modela.
Pročitaj i: GPT-6 Astra, OpenAI najavio eru AGI, brojke su skromnije. Ovaj test je konkretna nova informacija u odnosu na sam lansirni članak, prvi put pokazuje nezavisno izmjeren odnos cijene i kvaliteta u praktičnom zadatku, ne samo benčmark brojke koje je objavio proizvođač.

Naša perspektiva, šta ovo znači za firme u regionu
Za softversku firmu koja plaća pretplatu na AI alat za pregled koda, poenta nije "prebaci sve na Astru" niti "ostani na jeftinijem modelu", nego selektivan pristup. Ako tim radi pretežno na manjim, izolovanim izmjenama, jeftiniji model kao Sol ili Terra hvata skoro istu količinu grešaka po mnogo nižoj cijeni. Ako tim redovno radi na velikim refaktorisanjima gdje se jedna izmjena provlači kroz desetine fajlova, baš onoj vrsti posla gdje ljudski recenzent najlakše nešto previdi, razlika od 20 do 33 odsto više uhvaćenih bagova može opravdati veću cijenu Astre.
Praktičan korak za firmu poput softverskog studija u regionu, umjesto da odmah promijeni model za sav kod, vrijedi izdvojiti jednu vrstu zadatka, na primjer pregled prije velikog release-a, i tu paralelno testirati skuplji i jeftiniji model par sedmica, pa porediti koliko dodatnih grešaka skuplji model stvarno uhvati na sopstvenom kodu, ne na tuđem benčmarku.
Zaključak
CodeRabbit najavljuje da će nastaviti da testira Astru na dodatnim vrstama zadataka van pregleda koda, uključujući analizu dokumenata i istraživačke zadatke gdje se informacije moraju povezati iz više izvora. Vrijedi pratiti da li će se ista logika, veća cijena za bolje rezultate samo na težim, višeslojnim zadacima, pokazati i kod drugih alata za automatizaciju, ne samo kod pregleda koda.
Ako želiš svake sedmice da dobiješ pregled AI vijesti prevedenih na jasno "šta ovo znači za tvoj posao", prijavi se na AI Balkan newsletter.
Izvori:
CodeRabbit, GPT-6 Astra review: code review gains, privacy, and cost, 4. septembar 2026.
