Upozornenie: Tento príspevok bol vytvorený za asistencie umelej inteligencie pod vedením a s redakčnými úpravami človeka.
Artificial Analysis namerala novému modelu DeepSeek V4-Flash tri centy za prejdenie svojej testovacej batérie — proti 3,15 dolára pri Claude Fable 5, teda 105-krát menej.
Pre každý tím, ktorý platí za rutinné volania modelu, je to nová referenčná cena v obstarávaní. Podstatné však je, že to isté meranie dalo modelu 50 bodov zo 100 na indexe kvality, kým Claude Opus 5, Fable 5 a GPT-5.6 Sol sú aspoň o deväť bodov vyššie. Číslo o cene a číslo o kvalite pochádzajú z jedného zdroja a odpovedajú na dve rôzne otázky.
Čo meria cena za úlohu
Cena za úlohu nie je cenník. Zohľadňuje objem tokenov, ktoré model musí prečítať a napísať, aby úlohu dokončil — takže model s nízkou sadzbou môže vyjsť drahšie, ak potrebuje viac krokov. Práve preto je to užitočnejší údaj než cenníková sadzba, ktorou sa vendorské oznámenia zvyčajne argumentujú.
Cenník V4-Flash je 0,14 dolára za milión vstupných a 0,28 za milión výstupných tokenov. Model je pritom výrečný: na prejdenie tej istej batérie spotreboval 230 miliónov výstupných tokenov, kým medián pre modely jeho veľkosti je 88 miliónov. Vyhráva teda sadzbou, nie striedmosťou — a to je rozdiel, ktorý sa v dlhých agentových slučkách zmenšuje, nie zväčšuje.
Deväť bodov, ktoré v cenníku nevidno
Skóre 50 zo 100 znamená zhodu s Gemini 3.6 Flash a bod pod Muse Spark 1.1 od Meta aj GLM-5.2 od Z.AI. Kimi K3 má 57. Špičkové modely sú približne o desať bodov vyššie.
Tvrdší údaj priniesol Forbes z benchmarku AA-Omniscience: 37-percentná presnosť pri 84-percentnom podiele halucinácií. Toto číslo stojí na jednej metodike jedného hodnotiteľa a v hlavnom prehľade Artificial Analysis nie je, takže ho neberiem ako rovnocenné s cenou za úlohu. Ak sa potvrdí, hovorí to, že model je použiteľný tam, kde výstup niekto alebo niečo kontroluje, a nepoužiteľný tam, kde sa naň spoliehate.
Cenová hranica sa tým presúva z ceny modelu na cenu jeho kontroly. Tri centy za úlohu nič neznamenajú, ak výstup musí prejsť človekom s odbornou znalosťou — pretože ten človek je drahší než ktorýkoľvek model v porovnaní.
Protiargument
Najsilnejší argument proti tomuto čítaniu je architektúra. V4-Flash má 284 miliárd parametrov, z toho 13 miliárd aktívnych na token, a vychádza pod licenciou MIT. To znamená, že si ho viete spustiť vo vlastnej infraštruktúre — a teda aj kontrolovať vlastnými testami namiesto cudzieho benchmarku. Pre klasifikáciu, extrakciu dát alebo RAG s citáciami, kde výstup validuje kód, je podiel halucinácií menej rozhodujúci než pri otvorenej otázke.
Druhá výhrada: 50 bodov nie je zlé skóre, je to skóre svojej triedy. Zhoduje sa s platenou západnou alternatívou rovnakej kategórie. Porovnávať model triedy Flash so špičkou je porovnávanie, ktoré si vybral marketing, nie obstarávanie.
A tretia, na ktorú si treba dať pozor pri opačnom preháňaní: bezpečnostný index Future of Life Institute zo 7. júla dal DeepSeeku F so skóre 0,47 a Anthropicu C+ s 2,66. Ten index hodnotí zverejnené politiky a transparentnosť firiem, nie výstupy modelu. Nespája sa priamo s podielom halucinácií, aj keď to tak vyzerá.
Čo sledovať
Tri veci rozhodnú, či toto čítanie vydrží. Či niekto nezávisle zmeria cenu za úlohu v reálnej agentovej slučke, nie v benchmarkovej batérii — tam sa výrečnosť modelu prejaví plnou váhou. Kedy DeepSeek vydá V4-Pro, ktorý zatiaľ nemá termín. A či Anthropic s OpenAI potichu precenia svoje najnižšie triedy skôr, než si zákazníci prepočítajú rozdiel sami.
Štvrtý test príde skôr: Alibaba má tento týždeň zverejniť váhy modelu Qwen3.8-Max, ktorého 16-dňový autonómny beh zatiaľ nameral výrobca vlastnou obslužnou vrstvou. Až potom sa dá povedať, či čísla platia aj mimo Alibaby.







