Tri centy za úlohu, deväť bodov pod špičkou

Najlacnejší model zvládne úlohu za tri centy, Claude Fable 5 za 3,15 dolára. Ten istý index mu dáva o deväť bodov nižšiu kvalitu. Cenová hranica sa presúva z ceny modelu na cenu jeho kontroly.

Tri centy za úlohu, deväť bodov pod špičkou
Robot setri peniazky v prasiatku (Zdroj: Generovane pomocou ChatGPT)
Písmo: A- | A+

Upozornenie: Tento príspevok bol vytvorený za asistencie umelej inteligencie pod vedením a s redakčnými úpravami človeka.

Artificial Analysis namerala novému modelu DeepSeek V4-Flash tri centy za prejdenie svojej testovacej batérie — proti 3,15 dolára pri Claude Fable 5, teda 105-krát menej.

Pre každý tím, ktorý platí za rutinné volania modelu, je to nová referenčná cena v obstarávaní. Podstatné však je, že to isté meranie dalo modelu 50 bodov zo 100 na indexe kvality, kým Claude Opus 5, Fable 5 a GPT-5.6 Sol sú aspoň o deväť bodov vyššie. Číslo o cene a číslo o kvalite pochádzajú z jedného zdroja a odpovedajú na dve rôzne otázky.

SkryťVypnúť reklamu
Článok pokračuje pod video reklamou
SkryťVypnúť reklamu
Článok pokračuje pod video reklamou

Čo meria cena za úlohu

Cena za úlohu nie je cenník. Zohľadňuje objem tokenov, ktoré model musí prečítať a napísať, aby úlohu dokončil — takže model s nízkou sadzbou môže vyjsť drahšie, ak potrebuje viac krokov. Práve preto je to užitočnejší údaj než cenníková sadzba, ktorou sa vendorské oznámenia zvyčajne argumentujú.

Cenník V4-Flash je 0,14 dolára za milión vstupných a 0,28 za milión výstupných tokenov. Model je pritom výrečný: na prejdenie tej istej batérie spotreboval 230 miliónov výstupných tokenov, kým medián pre modely jeho veľkosti je 88 miliónov. Vyhráva teda sadzbou, nie striedmosťou — a to je rozdiel, ktorý sa v dlhých agentových slučkách zmenšuje, nie zväčšuje.

SkryťVypnúť reklamu

Deväť bodov, ktoré v cenníku nevidno

Skóre 50 zo 100 znamená zhodu s Gemini 3.6 Flash a bod pod Muse Spark 1.1 od Meta aj GLM-5.2 od Z.AI. Kimi K3 má 57. Špičkové modely sú približne o desať bodov vyššie.

Tvrdší údaj priniesol Forbes z benchmarku AA-Omniscience: 37-percentná presnosť pri 84-percentnom podiele halucinácií. Toto číslo stojí na jednej metodike jedného hodnotiteľa a v hlavnom prehľade Artificial Analysis nie je, takže ho neberiem ako rovnocenné s cenou za úlohu. Ak sa potvrdí, hovorí to, že model je použiteľný tam, kde výstup niekto alebo niečo kontroluje, a nepoužiteľný tam, kde sa naň spoliehate.

SkryťVypnúť reklamu

Cenová hranica sa tým presúva z ceny modelu na cenu jeho kontroly. Tri centy za úlohu nič neznamenajú, ak výstup musí prejsť človekom s odbornou znalosťou — pretože ten človek je drahší než ktorýkoľvek model v porovnaní.

SkryťVypnúť reklamu

Protiargument

Najsilnejší argument proti tomuto čítaniu je architektúra. V4-Flash má 284 miliárd parametrov, z toho 13 miliárd aktívnych na token, a vychádza pod licenciou MIT. To znamená, že si ho viete spustiť vo vlastnej infraštruktúre — a teda aj kontrolovať vlastnými testami namiesto cudzieho benchmarku. Pre klasifikáciu, extrakciu dát alebo RAG s citáciami, kde výstup validuje kód, je podiel halucinácií menej rozhodujúci než pri otvorenej otázke.

Druhá výhrada: 50 bodov nie je zlé skóre, je to skóre svojej triedy. Zhoduje sa s platenou západnou alternatívou rovnakej kategórie. Porovnávať model triedy Flash so špičkou je porovnávanie, ktoré si vybral marketing, nie obstarávanie.

SkryťVypnúť reklamu

A tretia, na ktorú si treba dať pozor pri opačnom preháňaní: bezpečnostný index Future of Life Institute zo 7. júla dal DeepSeeku F so skóre 0,47 a Anthropicu C+ s 2,66. Ten index hodnotí zverejnené politiky a transparentnosť firiem, nie výstupy modelu. Nespája sa priamo s podielom halucinácií, aj keď to tak vyzerá.

Čo sledovať

Tri veci rozhodnú, či toto čítanie vydrží. Či niekto nezávisle zmeria cenu za úlohu v reálnej agentovej slučke, nie v benchmarkovej batérii — tam sa výrečnosť modelu prejaví plnou váhou. Kedy DeepSeek vydá V4-Pro, ktorý zatiaľ nemá termín. A či Anthropic s OpenAI potichu precenia svoje najnižšie triedy skôr, než si zákazníci prepočítajú rozdiel sami.

Štvrtý test príde skôr: Alibaba má tento týždeň zverejniť váhy modelu Qwen3.8-Max, ktorého 16-dňový autonómny beh zatiaľ nameral výrobca vlastnou obslužnou vrstvou. Až potom sa dá povedať, či čísla platia aj mimo Alibaby.

Martin Sečkár

Martin Sečkár

Bloger 
  • Počet článkov:  24
  •  | 
  • Páči sa:  21x

Pouzivam AI na pisanie pribehov, komentarov a svojho newsletra zamerane na AI novinky(https://www.linkedin.com/newsletters/svet-ai-tvoren%C3%BD-ai-7349186484307951619/). Priestor na sme.sk by som rad vyuzit na umiestnenie AI vytvorenych, clovekom overenych poviedok a komentarov k aktualnemu dianiu. Hladam priestor kde sa vyjadrit a neostat ticho v tejto zlozitej spolocenskej situacii. Zoznam autorových rubrík:  Nezaradená

Prémioví blogeri

Juraj Hipš

Juraj Hipš

12 článkov
Marian Nanias

Marian Nanias

340 článkov
Pavol Koprda

Pavol Koprda

10 článkov
Tupou Ceruzou

Tupou Ceruzou

330 článkov
Milota Sidorová

Milota Sidorová

5 článkov
reklama
SkryťZatvoriť reklamu