Više nije važno samo koliko model zna
Qwen, Kimi, DeepSeek i Doubao vode novu generaciju kineskih AI modela, ali nova utrka više se ne vodi samo oko matematičkih zadataka i općeg znanja. Programiranje, autonomni agenti, planiranje složenih zadataka i kontrola halucinacija postaju jednako važni pokazatelji stvarne upotrebljivosti umjetne inteligencije.
Kineska AI industrija tijekom 2026. godine ulazi u novu fazu.
Nakon razdoblja u kojem se uspjeh velikih jezičnih modela prvenstveno mjerio rezultatima na matematičkim, logičkim i akademskim testovima, fokus se sve više pomiče prema sposobnosti modela da obavljaju stvarne zadatke pišu i popravljaju programski kod, koriste alate, planiraju više koraka unaprijed i autonomno izvršavaju složenije projekte.
U središtu nove kineske AI utrke nalaze se Alibaba s obitelji Qwen, Moonshot AI s modelima Kimi,
DeepSeek, ByteDanceov Doubao, Zhipu AI s obitelji GLM te niz drugih domaćih proizvođača.
Važno: SuperCLUE nije samo ljestvica kineskih modela
SuperCLUE je kineski benchmark i njegova glavna svrha jest procjena velikih jezičnih modela u kineskom jezičnom i uporabnom okruženju. Međutim, njegove opće evaluacije uključuju i vodeće međunarodne modele. Strani modeli mogu služiti kao referentna točka, dok se službeni
poredak domaćih kineskih modela može voditi zasebno.
Od pitanja „koliko zna?“ prema pitanju „što može napraviti?“
To je možda najvažnija promjena koju donose novi AI benchmarkovi. Klasični testovi mogli su vrlo dobro pokazati koliko je model sposoban riješiti matematički problem, odgovoriti na pitanje iz znanosti ili
prepoznati točan odgovor među nekoliko ponuđenih mogućnosti.
Ali stvarni korisnik od AI sustava očekuje mnogo više. Programer ne želi samo da mu model napiše deset redaka koda. Želi da AI razumije postojeći projekt, pronađe pogrešku, promijeni više datoteka,
pokrene alat, provjeri rezultat i nastavi raditi ako prvi pokušaj nije uspio.
Upravo tu počinje era agentne umjetne inteligencije.
Šest sposobnosti koje otkrivaju stvarnu snagu AI modela
SuperCLUE u svojim općim evaluacijama promatra šest različitih područja koja zajedno daju znatno širu sliku sposobnosti modela.
01 Matematičko zaključivanje
Sposobnost rješavanja matematičkih problema i izvođenja višekoračnih zaključaka.
02 Znanstveno zaključivanje
Razumijevanje i povezivanje znanstvenih činjenica, problema i koncepata.
03 Programiranje
Pisanje, razumijevanje i rješavanje stvarnih programerskih problema.
04 Precizno praćenje uputa
Može li model napraviti upravo ono što korisnik traži bez odstupanja?
05 Kontrola halucinacija
Koliko dobro model izbjegava izmišljanje činjenica i nepouzdanih odgovora.
06 Planiranje zadataka
Može li složeni cilj podijeliti na korake i samostalno planirati izvršenje?
Qwen, Kimi i DeepSeek ne pobjeđuju u istim disciplinama
Jedan od najzanimljivijih zaključaka novih usporedbi jest da više ne postoji jednostavan odgovor na pitanje: koji je kineski AI model najbolji?
Model koji je izvrstan u matematičkom zaključivanju ne mora biti najbolji programer. Model koji vrlo dobro planira zadatke može biti sporiji ili skuplji. Drugi model može postići nešto niži ukupni rezultat, ali ponuditi mnogo bolji omjer cijene i performansi.
Zbog toga ukupna pozicija na benchmarku postaje samo početak analize, a ne konačan odgovor.
Qwen naglasak na svestranosti
Alibabina Qwen obitelj posljednjih generacija snažno napreduje u zaključivanju, programiranju, radu s alatima i agentnim zadacima. Posebno je zanimljiva sposobnost modela da kombinira više različitih vrsta zadataka unutar jednog radnog procesa.
Kimi ozbiljan igrač u programiranju i agentima
Moonshot AI napravio je veliki tehnološki iskorak s generacijom Kimi K3. Model ima 2,8 bilijuna parametara u Mixture-of-Experts arhitekturi, uz 104 milijarde aktivnih parametara, podršku za vrlo dugačak kontekst i naglašene sposobnosti za programiranje i dugotrajno izvršavanje agentnih zadataka.
DeepSeek performanse i cijena
DeepSeek je posljednjih generacija privukao veliku pozornost upravo kombinacijom visokih sposobnosti zaključivanja i agresivnog pristupa troškovima izvođenja. To ga čini posebno zanimljivim programerima i tvrtkama koje moraju izvršavati velik broj AI zahtjeva.
Doubao ByteDanceov odgovor konkurenciji
ByteDance razvija Doubao kao jednu od ključnih komponenti vlastitog AI ekosustava. Modeli ove obitelji pokazuju da kineska AI utrka više nije dvoboj Alibabe i DeepSeeka, nego tržište s nekoliko tehnološki vrlo snažnih konkurenata.
Kimi K3 pokazuje koliko brzo raste kineski AI
Dobar primjer brzine razvoja predstavlja Kimi K3. Moonshot AI navodi da model koristi Mixture-of-Experts arhitekturu s ukupno 2,8 bilijuna parametara, od kojih je približno 104 milijarde aktivno tijekom izvođenja.
Model podržava kontekst do milijun tokena i razvijan je posebno za dugotrajne zadatke koji uključuju programiranje, korištenje alata, zaključivanje i agentne radne procese.
To je važan pokazatelj smjera u kojem se industrija kreće. Povećavanje modela samo po sebi više nije dovoljno proizvođači pokušavaju poboljšati način na koji AI raspoređuje računalne resurse i koliko
dugo može pouzdano izvršavati zadatak bez intervencije korisnika.
A gdje su GPT, Gemini i Claude?
Ovdje je potreban važan kontekst.
SuperCLUE nije izoliran od međunarodne AI scene. U njegovoj javno objavljenoj općoj evaluaciji za svibanj 2026. kao referentni modeli pojavljuju se i Google Gemini, OpenAI GPT te Anthropic Claude.
U toj evaluaciji strani modeli zauzimali su nekoliko najviših mjesta prema ukupnom rezultatu, dok su se DeepSeek, Qwen i Doubao nalazili na samom vrhu skupine kineskih modela.
Što to znači?
Ako Qwen, Kimi ili DeepSeek osvoje prvo mjesto na ljestvici kineskih modela, to ne znači automatski da su postali najbolji AI modeli na svijetu. Za takvu tvrdnju potreban je isti test, ista
metodologija i izravna usporedba s aktualnim verzijama GPT-a, Gemini-ja, Claudea i drugih vodećih međunarodnih sustava.
Najbolji model ovisi o tome što želite napraviti
| Potreba korisnika | Što je najvažnije | Modeli vrijedni praćenja |
|---|---|---|
| Programiranje | Agentni rad, kod, korištenje alata | Kimi / Qwen / DeepSeek |
| Matematika i logika | Precizno višekoračno zaključivanje | DeepSeek / Qwen |
| Poslovna automatizacija | Upute, agenti, planiranje | Qwen / Kimi |
| Velik broj API zahtjeva | Cijena i brzina izvođenja | DeepSeek i manji specijalizirani modeli |
| Dugi dokumenti i projekti | Kontekst i dugotrajni agentni rad | Kimi / Qwen |
Najveća promjena nije na ljestvici nego u načinu mjerenja AI-ja
Možda najvažnija priča uopće nije hoće li Qwen biti ispred Kimija ili će nova verzija DeepSeeka ponovno preuzeti vrh. Mnogo je važnije što benchmarkovi pokušavaju mjeriti.
AI industrija polako napušta razdoblje u kojem je impresivan rezultat na testu znanja bio dovoljan za proglašavanje novog modela revolucionarnim.
Sljedeća generacija umjetne inteligencije morat će dokazati da može raditi.
To znači otvoriti projekt, razumjeti problem, koristiti dostupne alate, napisati kod, provjeriti rezultat, prepoznati vlastitu pogrešku, ispraviti je i nastaviti prema cilju.
Evolucija generativnog AI-ja
2024. → „Analiziraj ovaj dokument“
2025. → „Razmišljaj i riješi problem“
2026. → „Napravi cijeli zadatak umjesto mene“
Zašto je kineska AI utrka važna i ostatku svijeta?
Razvoj kineskih modela više nije važan samo kineskom tržištu. DeepSeek je već pokazao da novi pristupi arhitekturi, treniranju i troškovima mogu utjecati na cijelu globalnu AI industriju.
Kimi, Qwen, GLM, Doubao i drugi modeli dodatno povećavaju pritisak na američke tehnološke kompanije jer pokazuju da se konkurencija više ne vodi samo između OpenAI-ja, Googlea i Anthropica.
Posebno je važan razvoj otvorenih modela. Dostupnost težina pojedinih kineskih modela omogućuje istraživačima i tvrtkama da ih pokreću, prilagođavaju i integriraju u vlastitu infrastrukturu bez potpune
ovisnosti o zatvorenim cloud platformama.
Prava bitka počinje tek sada
Rezultati benchmarka uvijek privlače pažnju jer nude jednostavnu ljestvicu pobjednika i gubitnika. Međutim, kod današnjih AI modela jedan ukupni rezultat sve manje govori cijelu priču.
Programeru može biti važniji model koji pouzdano radi nekoliko sati na projektu. Tvrtki koja obrađuje milijune zahtjeva važniji je trošak API-ja. Novinaru ili analitičaru ključna može biti kontrola halucinacija, dok će istraživaču biti važnije matematičko i znanstveno zaključivanje.
Upravo zato nova generacija benchmarkova predstavlja važan korak. Pitanje više nije samo „koji je AI najpametniji?“, nego „koji AI može najpouzdanije obaviti stvarni posao?“
Ako se sadašnji trend nastavi, 2026. mogla bi ostati zapamćena kao godina u kojoj su veliki jezični modeli počeli prelaziti iz inteligentnih chatbotova u stvarne digitalne agente.
Zaključak
Kineska AI scena više nema jednog očitog pobjednika. Qwen, Kimi, DeepSeek, Doubao i drugi modeli razvijaju različite prednosti, dok se njihove pozicije mogu mijenjati gotovo sa svakom novom generacijom.
No upravo je to možda najvažniji zaključak. Utrka više nije usmjerena samo prema većim modelima i boljim rezultatima na akademskim testovima. Sljedeća faza razvoja bit će obilježena agentima, programiranjem, korištenjem alata, dugoročnim planiranjem, manjim brojem halucinacija
i nižim troškovima izvođenja.
A kada AI može samostalno razumjeti cilj, napraviti plan, koristiti potrebne alate i provjeriti vlastiti rezultat, više ne govorimo samo o chatbotu. Govorimo o početku potpuno nove generacije računalnih sustava.
Napomena uredništva:
Rezultati AI benchmarka predstavljaju performanse modela u određenom skupu testova i ne treba ih tumačiti kao univerzalnu ljestvicu „najboljih AI modela“. Rezultati se mogu razlikovati ovisno o metodologiji, verziji modela, načinu izvođenja i vrsti zadatka.
Autor: Andrija Jovićević | : Sat-Multimedia & IT
📚 Najčitaniji članci:
Sat-Multimedia & IT portal Satelitska-IPTV-Multimedija od 2006