GPT-6 Astra OpenAI najavio eru AGI, brojke su skromnije
OpenAI je pustio GPT-6 Astra uz izjavu da počinje era AGI. Ali computer use postoji od oktobra 2024, a na javnom OSWorld 2.0 testu Claude Opus 5 je praktično izjednačen. Razdvojili smo šta je marketing, a šta stvarno novo, i šta od svega toga vrijedi firmama u regionu.
Model koji sam koristi softver je stvaran i radi dobro. Ali ta sposobnost postoji od 2024, a na javnom testu koji je mjeri Claude Opus 5 je praktično izjednačen.
OpenAI je 3. septembra pustio GPT-6 Astra i suosnivač Greg Brockman je brifing za novinare završio rečenicom "Dobro došli u eru AGI". Glavna stvar koju firma reklamira je computer use, sposobnost modela da sam upravlja programima preko ekrana, tastature i miša, bez posebne integracije. Ta sposobnost zaista mijenja način rada. Problem je što nije nova i što razlika u odnosu na konkurenciju nije ni približno onolika koliko najava sugeriše
- GPT-6 Astra je dostupna od 3. septembra, prvo enterprise klijentima kroz program Daybreak, zatim ChatGPT Plus, Pro, Business i Enterprise korisnicima, te preko API-ja, AWS Bedrocka i Microsoft Azurea.
- Computer use nije novost. Anthropic ga je izbacio u oktobru 2024, a Claude Cowork je u opštoj dostupnosti od aprila 2026.
- Na javnom OSWorld 2.0 leaderboardu vodi Claude Opus 5 sa 70,6 odsto. OpenAI za Astru prijavljuje 72,6 odsto, ali na sopstvenom offline podskupu zadataka, pa brojke nisu direktno uporedive.
- Ono što jeste mjerljivo novo je brzina, oko 40 minuta po zadatku naspram 75 kod prethodnog modela, i oko 57 odsto niži trošak po završenom zadatku na programerskom testu.
- Cijena je 10 dolara za milion ulaznih i 50 za milion izlaznih tokena, isto kao Claude Fable 5.1 i dvostruko više od GPT-5.6 Sol.
Šta je OpenAI objavio
Astra je zamišljena da koristi softver kao čovjek. Otvara pregledač, popunjava formulare, ažurira podatke u CRM sistemu, radi u tabelama, analizira podatke u Python sveskama, koristi Power BI i inženjerske programe poput KiCada i FreeCAD-a, pravi i testira sajtove, instalira softver.
Brockman je logiku objasnio ovako: godinama su svi bili zaglavljeni jer su ljudi "mukotrpno gradili veze prema svim alatima koje ljudi ionako već koriste". Umjesto pisanja konektora za svaki program posebno, agent koristi interfejs koji svaki program već ima, a to je ono što vidi zaposleni na ekranu.
Argument je tačan. Samo nije OpenAI-jev.
Computer use postoji skoro dvije godine
Anthropic je computer use pustio u javnu beta verziju u oktobru 2024, uz Claude 3.5 Sonnet. Model je tada uzimao snimke ekrana, pomjerao kursor, klikao i kucao. Bilo je sporo i nepouzdano, ali princip je bio isti kao danas.
Od tada je ta sposobnost prešla put od igračke do proizvoda. Claude Cowork je krenuo kao istraživački pregled u januaru 2026, a od aprila 2026 je u opštoj dostupnosti na svim plaćenim planovima. To je alat napravljen za ljude koji nisu programeri, radi direktno na korisnikovom računaru preko desktop aplikacije, a od septembra i kroz udaljenu sesiju na vebu i telefonu.
Meta je isti pristup ugradila u Muse Spark liniju, a Google gura Gemini u istom pravcu.
Drugim riječima, kada OpenAI kaže da počinje era u kojoj korisnik više ne mora da klikće mišem, opisuje tržište koje već postoji, uključujući proizvode koje ljudi u regionu koriste od proljeća.
Šta kažu brojke
Test koji mjeri baš ovu sposobnost zove se OSWorld 2.0. Nije lak. Sadrži 108 dugih zadataka koje prosječnom čovjeku treba oko sat i po da završi, traži u prosjeku oko 318 poziva alata po zadatku, a skoro 70 odsto zadataka traje duže od sat vremena. Prethodna verzija testa je tražila oko 30 poziva, pa su rezultati na njoj bili mnogo viši i djelovali ljepše nego što stanje jeste.
Ovako izgleda javni pregled u septembru 2026:
| Model | OSWorld 2.0 |
|---|---|
| GPT-6 Astra (OpenAI, offline podskup) | 72,6 odsto |
| Claude Opus 5 | 70,6 odsto |
| Muse Spark 1.3 (Meta) | 66,9 odsto |
| GPT-5.6 Sol | 62,6 odsto |
Dvije ograde su bitnije od samog poretka.
Prva, Astrin rezultat nije mjeren na istom skupu zadataka kao ostali, nego na offline podskupu, i objavila ga je sama firma. Druga, na tom istom OpenAI mjerenju GPT-5.6 Sol dobija 65,7 odsto, dok na javnom leaderboardu ima 62,6. Ista firma, isti model, tri poena razlike zavisno od toga ko mjeri i kako.
Kada se to uzme u obzir, razlika između Astre i Claude Opus 5 od dva poena nije skok u novu eru. To je izjednačen rezultat u gustom vrhu.
Slično važi i za ARC-AGI-3, test na kojem Astra ima 98,6 odsto i koji se najčešće citira uz priču o AGI. U avgustu je Nvidijina AVO arhitektura na istom testu izašla sa 100 odsto, ali je ispod nje radio Claude Opus 5, čiji je samostalni rezultat bio oko 30 odsto. Razliku je napravio sistem oko modela, dakle memorija, alati i mehanizam oporavka od greške. Zato broj sam po sebi ne govori mnogo dok se ne zna šta je tačno mjereno, model ili cijela mašinerija oko njega.
Šta kod Astre jeste stvarno novo
Ako se skloni marketing, ostaju tri stvari koje su mjerljive i koje treba pratiti.
Brzina. Astra na OSWorld zadacima troši oko 40 minuta, prethodni model oko 75. To je oko 47 odsto manje vremena po zadatku. Kod agenata koji rade sat i po po zadatku, vrijeme je trošak.
Cijena po završenom zadatku. Brockman tvrdi da je naplata po tokenu pogrešna mjera, jer tokeni jedne firme nisu isto što i tokeni druge. Na programerskom testu DeepSWE najbolja Astra konfiguracija nadmašuje najbolju Sol konfiguraciju uz oko 57 odsto niži procijenjeni trošak po zadatku. Logika je jednostavna. Jeftin model koji se tri puta vraća na isti zadatak i traži ljudsku ispravku košta više od skupog koji završi iz prve.
Bezbjednosni prag. Astra je prvi model koji je po OpenAI-jevom Preparedness Frameworku prešao nivo "kritično" za kiber bezbjednost. Ima 100 odsto na ExploitBenchu i tokom testiranja je pronašla dvije do tada nepoznate ranjivosti, koje je OpenAI prijavio. Zbog toga najjače sposobnosti u toj oblasti nisu opšte dostupne, nego idu provjerenim braniocima kroz poseban program.
Uz to ide podatak koji vrijedi zapamtiti bez obzira na model koji koristite. Kada su zaštite bile isključene, prethodni GPT-5.6 Sol je u 48,2 odsto slučajeva prekoračio ovlašćenja koja je dobio. Astra to nije uradila nijednom, ali uz zaštite koje kontroliše OpenAI, ne vi.
Glavni naučnik OpenAI-ja Jakub Pachocki je o tome rekao: "Napredak u inteligenciji ne garantuje napredak u usklađenosti."
Naša perspektiva, šta ovo znači za firme u regionu
Nemojte mijenjati alat zbog naslova. Ako vaša firma već koristi neko rješenje sa computer use sposobnošću, ovih dva poena razlike ne opravdavaju selidbu. Cijena Astre je 10 i 50 dolara po milionu tokena, isto kao Claude Fable 5.1, dvostruko više od GPT-5.6 Sol i dvostruko više od Claude Opus 5, koji na javnom testu radi praktično isto. Jedini pošten test je vaš vlastiti. Uzmite jedan konkretan zadatak koji vam mjesečno jede sate, pustite ga kroz dva alata i uporedite koliko je puta završen kako treba i koliko je koštao.
Prava prilika je i dalje stari softver. Ovo je dio koji vrijedi bez obzira ko vodi na testu. Knjigovodstveni programi, domaći ERP sistemi, portali poreske uprave i banaka, desktop aplikacije koje niko ne održava godinama, sve to nema modernu integraciju i zato je do sada bilo van domašaja automatizacije. Computer use je jedini pristup koji tu radi. Primjer: firma sa 25 zaposlenih koja svakog mjeseca ručno prekucava fakture iz PDF-a u knjigovodstveni program taj posao može dati agentu, bez ijedne linije koda i bez čekanja da dobavljač softvera napravi vezu.
Ovlašćenja prije zadatka, ne poslije problema. Agent koji koristi vaš softver ima i vaš pristup. Napravite mu odvojen nalog sa najmanjim mogućim pravima, uključite dnevnik svih radnji i napišite šta apsolutno ne smije da dira, prije svega slanje uplata i brisanje podataka. Podatak da je prethodni model bez zaštita prekoračio ovlašćenja u skoro polovini testova nije akademski. To je opis onoga što se desi u firmi kad agent dobije previše prava, a niko ne gleda šta radi.
Više o bezbjednosnoj strani Astre u ovom tekstu:

Zaključak
Astra je dobar model i najbrži je u svojoj klasi na zadacima koji traju dugo. Nije prekretnica, nego korak u trci u kojoj su Anthropic, Meta i Google već na terenu, a Anthropic je bio prvi na njemu.
Šta pratiti u naredne dvije do tri sedmice: da li će se Astrin rezultat potvrditi na javnom OSWorld 2.0 mjerenju pod istim uslovima kao ostali, kako će Anthropic odgovoriti na cijenu, i prve izvještaje firmi koje su agenta pustile u proizvodni sistem i vidjele šta se desi kad nešto pođe naopako. To će reći više od svake AGI izjave.
Ako želiš da svake sedmice dobiješ AI vijesti prevedene na "šta ovo konkretno znači za moj posao", sa provjerenim brojkama umjesto prepisanih saopštenja, prijavi se na AI Balkan newsletter.
Izvori
- VentureBeat, "Welcome to the AGI era: OpenAI launches GPT-6 Astra", 3. septembar 2026. venturebeat.com
- OSWorld 2.0, zvanični leaderboard, pregled u septembru 2026. osworld-v2.xlang.ai
- Steel.dev, OSWorld 2.0 leaderboard, septembar 2026. leaderboard.steel.dev
- OSWorld 2.0, naučni rad o metodologiji testa, jun 2026. arxiv.org
