Astrine dôkazy si overíte sami. Rekordy modelov nie.

Astrine dôkazy vyšli s Lean certifikátmi, ktoré si overí ktokoľvek. Rekordné skóre DeepSeeku a Kimi nameral výrobca vlastnou obslužnou vrstvou. Rozdiel rozhoduje o tom, podľa čoho vyberáte model.

Astrine dôkazy si overíte sami. Rekordy modelov nie.
Robot skumajuci matematicke dokazy (Zdroj: Generovane pomocou ChatGPT)
Písmo: A- | A+

Upozornenie: Tento príspevok bol vytvorený za asistencie umelej inteligencie pod vedením a s redakčnými úpravami človeka.

Pre koho vyberá nástroje do produkcie, je ten rozdiel praktický: podľa prvého typu tvrdenia sa rozhodovať dá, podľa druhého zatiaľ nie.

Čo Lean overí a čo neoverí

Podľa OpenAI ide o desať problémov z vysokodimenzionálnej geometrie, teórie kódov, teórie grúp, operátorových algebier, zložitosti obvodov, kvantovej zložitosti, mriežkovej kryptografie a extremálnej kombinatoriky, pri ktorých sa v hlavnej otázke aspoň desať rokov nepohlo. Hlavný výsledok je explicitná konštrukcia nesofickej grupy — otázka otvorená od roku 1999 — a vyvrátenie Connesovej hypotézy o rigidite. Firma vydala 249-stranovú zbierku rukopisov a Lean 4 certifikáty pre všetkých desať výsledkov na GitHube pod licenciou Apache 2.0; repozitár uvádza nulový počet nedokončených krokov.

SkryťVypnúť reklamu
Článok pokračuje pod video reklamou
SkryťVypnúť reklamu
Článok pokračuje pod video reklamou

To je iná trieda dôkazu než pri májovom vyvrátení Erdősovej hypotézy o jednotkových vzdialenostiach. Vtedy argument čítalo a podpísalo deväť externých matematikov — silný, ale spoločenský signál, ktorý sa bez tých istých ľudí nedá zopakovať. Lean ich čas nepotrebuje.

Hranica je však presná. Lean overí, že dôkaz platí pre tvrdenie tak, ako je v Leane zapísané. Či je to verné znenie problému, ktorý matematici považovali za otvorený, posudzuje zatiaľ OpenAI o vlastných výsledkoch, s vlastnými výskumníkmi ako autormi rukopisov. Žiadny z desiatich výsledkov neprešiel recenzným konaním.

Noam Brown, jeden z autorov použitej technológie, sám tlmil očakávania: „Bohužiaľ, zatiaľ žiadne problémy Millennium Prize." (Sadly, no Millennium Prize Problems (yet).) Náklady na tokeny potrebné na nájdenie všetkých desiatich riešení odhaduje OpenAI na približne 2 000 dolárov pri sadzbách API Sol — je to odhad ceny inferencie, nie ceny výskumu.

SkryťVypnúť reklamu

Rekordy, ktoré nameral výrobca

DeepSeek vydal 31. júla finálnu verziu V4 Flash so skóre 82,7 na Terminal-Bench 2.1, oproti 61,8 pri aprílovej preview verzii. Architektúra ani veľkosť sa nezmenili — 284 miliárd parametrov, 13 miliárd aktívnych — model bol iba znova dotrénovaný.

SkryťVypnúť reklamu

Všetky tie čísla nameral DeepSeek vlastnou obslužnou vrstvou (harness) v režime minimal pri maximálnom výpočtovom úsilí. Firma sľubuje, že obslužnú vrstvu zverejní, aby sa dali behy zreprodukovať. Dovtedy ide o tvrdenie výrobcu, nie o meranie.

Ako veľa na obslužnej vrstve záleží, ukazuje rozpor priamo medzi agregátormi: pre Claude Fable 5 sa na tom istom Terminal-Bench 2.1 uvádza 80,5 aj 88,0. Rozdiel nerobí model.

SkryťVypnúť reklamu

Na SWE-bench Verified — 500 overených úloh z reálnych GitHub issues — má DeepSeek-V4-Pro-Max 80,6 %, najviac spomedzi otvorených modelov a ôsme miesto celkovo. Na čele je Claude Opus 5 so 97,0 %, za ním GPT-5.6 Sol s 96,2 %, Claude Fable 5 s 95,0 % a Kimi K3 s 93,4 %. Rebríček llm-stats pritom označuje všetkých 104 zaznamenaných výsledkov za nahlásené tvorcami modelov, žiadny za nezávisle overený.

Jediné nezávislé meranie odstupu

Britský AI Security Institute zverejnil prvú verejnú analýzu toho, ako ďaleko za uzavretou špičkou sú otvorené modely: GLM-5.2 a DeepSeek V4-Pro sa správajú ako uzavreté modely vydané o štyri až sedem mesiacov skôr, zatiaľ čo počas roka 2025 bol odstup šesť až desať mesiacov.

SkryťVypnúť reklamu

Odstup teda klesá a nie je nulový. AISI zároveň uvádza, že pri dlhších reťazených úlohách sa medzera opäť predlžuje — a meria kyberbezpečnosť, nie kódovanie či matematiku.

Protiargument

Nezávislé indexy dávajú otvorenej strane silnejšiu pozíciu, než z akej vychádza tento text. Kimi K3 je druhý na indexe Vals AI a tretí na Artificial Analysis Intelligence Index, pričom pred ním sú len Claude Fable a GPT-5.6 Sol Max — a je lacnejší než oba. Obe merania robí tretia strana.

Cenu a hardvér to však nemení. Váhy K3 zaberajú v štvorbitovej presnosti asi 1,4 TB rýchlej pamäte, čo znamená viacakcelerátorový serverový uzol, nie pracovnú stanicu. „Otvorené" tu znamená auditovateľné, nie spustiteľné u vás.

Čo sledovať

Tri veci rozhodnú, či tvrdenia z tohto týždňa vydržia: či nezávislí matematici potvrdia zhodu formálnych znení Astriných viet s pôvodnými problémami; či DeepSeek zverejní svoju obslužnú vrstvu; a ako dopadne test Kimi K3, ktorý AISI ohlásil na obdobie po zverejnení váh.


Martin Sečkár

Martin Sečkár

Bloger 
  • Počet článkov:  29
  •  | 
  • Páči sa:  24x

Pouzivam AI na pisanie pribehov, komentarov a svojho newsletra zamerane na AI novinky(https://www.linkedin.com/newsletters/svet-ai-tvoren%C3%BD-ai-7349186484307951619/). Priestor na sme.sk by som rad vyuzit na umiestnenie AI vytvorenych, clovekom overenych poviedok a komentarov k aktualnemu dianiu. Hladam priestor kde sa vyjadrit a neostat ticho v tejto zlozitej spolocenskej situacii. Zoznam autorových rubrík:  Nezaradená

Prémioví blogeri

INESS

INESS

131 článkov
Iveta Rall

Iveta Rall

91 článkov
Igor Pogány

Igor Pogány

5 článkov
Pavel Macko

Pavel Macko

214 článkov
Roman Kebísek

Roman Kebísek

113 článkov
reklama
SkryťZatvoriť reklamu