NVIDIA: Ako Platforma Blackwell Definuje Výkon

V dnešnej dobe sa spoločnosť NVIDIA právom považuje za hnací motor pre architektúru umelej inteligencie.

NVIDIA:  Ako Platforma Blackwell Definuje Výkon
NVIDIA Dynamo
Písmo: A- | A+

V dnešnej dobe sa spoločnosť NVIDIA právom považuje za hnací motor pre architektúru umelej inteligencie, a preto by bola škoda nespomenúť jej inovatívne prínosy.

Platforma NVIDIA Blackwell sa v nedávnom nezávislom benchmarku SemiAnalysis InferenceMAX v1 ukázala ako absolútna špička. Dosiahla najvyšší výkon a efektívnosť s najnižšími celkovými nákladmi na vlastníctvo (TCO) vo všetkých testovaných modeloch a scenároch použitia.

Škálujeme AI pre Milióny Užívateľov

Súčasné, mimoriadne komplexné modely umelej inteligencie, ako sú napríklad rozsiahle modely typu mixture-of-experts (MoE), si vyžadujú obrovský výpočtový výkon. Na to, aby bolo možné obslúžiť milióny súbežných používateľov a zabezpečiť bleskové odozvy, je nevyhnutné distribuovať (alebo rozdeliť) inferenciu medzi viaceré servery (uzly).

SkryťVypnúť reklamu
Článok pokračuje pod video reklamou
SkryťVypnúť reklamu
Článok pokračuje pod video reklamou

Tu prichádza na rad softvérová platforma NVIDIA Dynamo. Táto platforma odomyká výkonné viacuzlové funkcie pre produkčné nasadenie. Umožňuje tak podnikom dosiahnuť rovnaký špičkový výkon a efektívnosť, aké boli zaznamenané v benchmarku, a to v rámci všetkých ich existujúcich cloudových prostredí.

Rozdelená Inferenčná Obsluha: Kľúč k Optimalizovanému Výkonu

Pri modeloch, ktoré sa zmestia na jeden server, vývojári často spúšťajú veľa identických kópií modelu paralelne na viacerých uzloch, aby maximalizovali priepustnosť. Napríklad, Russ Fellows zo spoločnosti Signal65 nedávno demonštroval rekordnú priepustnosť 1,1 milióna tokenov za sekundu pri použití 72 grafických kariet NVIDIA Blackwell Ultra.

SkryťVypnúť reklamu

Avšak, pri škálovaní AI modelov na obsluhu veľkého množstva súčasných používateľov v reálnom čase, alebo pri práci s náročnými úlohami s dlhými vstupnými sekvenciami, prináša technika disaggregated serving (rozdelená obsluha) ďalšie, významné zvýšenie výkonu a efektívnosti.

Disaggregated Serving: Obsluha AI modelov zahŕňa dve hlavné fázy:

  1. Spracovanie vstupu (prefill).

  2. Generovanie výstupu (decode).

Tradične tieto fázy bežia na rovnakých GPU, čo často vedie k preťaženiu a neefektívnemu využitiu zdrojov. Disaggregated serving tento problém rieši inteligentným rozdelením úloh na nezávisle optimalizované GPU. To zabezpečuje, že každá časť záťaže využíva najvhodnejšie optimalizačné techniky, čím sa maximalizuje celkový výkon. Pre moderné rozsiahle AI modely a MoE (napr. DeepSeek-R1) je táto technika nevyhnutná.

NVIDIA Dynamo jednoducho prináša tieto funkcie, vrátane disaggregated serving, do produkčného prostredia naprieč klastrami GPU.

SkryťVypnúť reklamu

Zrýchlenie a Úspora

Spoločnosť Baseten napríklad využila NVIDIA Dynamo na dvojnásobné zrýchlenie inferenčného servisu pre generovanie kódu s dlhým kontextom a zvýšenie priepustnosti o 1,6x. A to všetko bez dodatočných nákladov na hardvér. Takéto softvérovo riadené zvýšenie výkonu umožňuje poskytovateľom AI služieb výrazne znížiť výrobné náklady.

SkryťVypnúť reklamu

Integrácia a Škálavanie v Cloude

Rovnako ako pri rozsiahlych AI tréningoch, aj pri rozdelenej inferenčnej obsluhe je Kubernetes – štandard pre správu kontajnerových aplikácií – ideálny pre škálovanie služieb cez desiatky až stovky uzlov v podnikovom meradle.

Vďaka hlbokej integrácii NVIDIA Dynamo do spravovaných služieb Kubernetes od všetkých hlavných cloudových gigantov, môžu zákazníci efektívne škálovať viacuzlovú inferenciu v systémoch NVIDIA Blackwell, vrátane GB200 a GB300 NVL72.

  • Amazon Web Services (AWS) urýchľuje generatívnu inferenciu AI integráciou Dynamo s Amazon EKS.

  • Google Cloud ponúka receptúru Dynamo pre optimalizáciu inferencie rozsiahlych jazykových modelov (LLM) na svojom AI Hypercomputer.

  • Microsoft Azure umožňuje viacuzlovú inferenciu LLM s Dynamo na Azure Kubernetes Service.

  • Oracle Cloud Infrastructure (OCI) využíva Dynamo s OCI Superclusters.

  • Aj partneri ako Nebius navrhujú svoje cloudy na akcelerovanej výpočtovej infraštruktúre NVIDIA, pričom Dynamo je kľúčovým ekosystémovým partnerom.

Zjednodušenie Inferencie s NVIDIA Grove

Rozdelená inferencia AI si vyžaduje zložitú koordináciu viacerých špecializovaných komponentov (prefill, decode, smerovanie, atď.), pričom každý má odlišné požiadavky. Výzvou už nie je len spúšťanie kópií modelu, ale skôr riadenie týchto rôznorodých komponentov ako jedného, súdržného a vysoko výkonného systému.

SkryťVypnúť reklamu

NVIDIA Grove, nové programové rozhranie dostupné v NVIDIA Dynamo, rieši túto komplexnosť. Používateľom umožňuje zadať jedinú špecifikáciu na vysokej úrovni, ktorá popisuje celý ich inferenčný systém.

Príklad so Grove: Užívateľ deklaruje: „Potrebujem tri uzly GPU na prefill a šesť uzlov GPU na decode, a požadujem, aby všetky uzly pre danú repliku modelu boli umiestnené na rovnakom vysokorýchlostnom prepojení pre čo najrýchlejšiu odozvu.“

Na základe tejto jednoduchej špecifikácie Grove automaticky spracuje celú komplexnú koordináciu: škálovanie, udržiavanie správnych pomerov a závislostí, spúšťanie v správnom poradí a strategické umiestnenie v klastri pre efektívnu komunikáciu.

Vďaka kombinácii Kubernetes a NVIDIA Dynamo s NVIDIA Grove sa vývoj distribuovaných inferenčných riešení stáva pre vývojárov oveľa jednoduchším, čo urýchľuje vytváranie a škálovanie inteligentných aplikácií.


Igor Vojtek

Igor Vojtek

Bloger 
  • Počet článkov:  45
  •  | 
  • Páči sa:  134x

Volám sa Igor, a vo svojom voľnom čase sa venujem tvorbe obsahu s umelou inteligenciou. Je to skvelý spôsob, ako premeniť nápady na originálne texty, obrázky alebo videá. No skrátka doba sa nemí a musíme sa tomu prispôsobiť. Zoznam autorových rubrík:  Nezaradená

Prémioví blogeri

Marian Nanias

Marian Nanias

340 článkov
Igor Pogány

Igor Pogány

5 článkov
Jana Čavojská

Jana Čavojská

26 článkov
Tupou Ceruzou

Tupou Ceruzou

330 článkov
Monika Nagyova

Monika Nagyova

305 článkov
reklama
SkryťZatvoriť reklamu