Tmavé pozadí

Otestovali jsme DELL Pro Max s GB10: kompaktní AI superpočítač, ale úplně server

Václav Kašpar
Václav Kašpar 31. 7. 2026
Otestovali jsme DELL Pro Max s GB10: kompaktní AI superpočítač, ale úplně server

Kolik výkonu skutečně dostanete za něco málo přes 100 000 Kč, když chcete provozovat vlastního AI asistenta úplně bez cloudu? Postavili jsme nový DELL Pro Max s čipem NVIDIA GB10 proti našim stávajícím GPU serverům a měřili. Výsledky nás v některých ohledech potěšily a v jiných dost překvapily.

## Proč jsme to vůbec testovali

Poptávka po plně on-premise AI roste a důvody jsou pochopitelné: citlivá data, regulace, veřejný sektor, interní dokumenty, které nesmí opustit budovu. Zákazníci se nás pravidelně ptají na jednu a tu samou věc — „dá se náš inteligentní asistent rozjet celý u nás, na jednom stroji?"

Odpověď „záleží na tom" je pravdivá, ale k ničemu. Samozřejmě, že to lze, ale otázkou je, za jakou cenu, s jakou kvalitou odpovědí a jakou rychlostí odpovídání. Chtěli jsme vyzkoušet řešení dostupné i pro menší zákazníky, a proto jsme si půjčili tento "kapesní" DELL, a proměřili ho na naší reálné platformě. Ne na syntetických demech, ale na tom, co u zákazníků skutečně běží: velký jazykový model, embedding model, vyhledávání, zpracování a OCR dokumentů, aplikační vrstva.

## Co je GB10 a proti čemu jsme ho postavili

DELL Pro Max s GB10 je kompaktní stroj postavený na čipu NVIDIA Grace Blackwell — CPU s architekturou ARM (aarch64) a GPU na jednom pouzdře, se sdílenou (unified) pamětí, z níž je systému dostupných zhruba 121 GiB. To je klíčový detail, ke kterému se ještě vrátíme: procesor a grafika se o tuto paměť dělí.

Srovnávali jsme ho se třemi stroji z našeho datacentra:

- referenční GPU server se 4× RTX 3090 (96 GB VRAM dohromady),
- rackový GPU server se 2× RTX 4090,
- produkční x86 server bez GPU, který nám sloužil jako CPU baseline.

## Jazykový model: čísla, která nelichotí

Pro test inferenčního výkonu jsme použili model **Qwen3.6-27B** ve vLLM a standardní `vllm bench serve` s deseti paralelními požadavky, aby test odpovídal reálnému provozu s více uživateli. Stejný model, stejný dataset, stejná zátěž na všech strojích.

| Metrika | DELL GB10 | 4× RTX 3090 | 2× RTX 4090 |
|---|---|---|---|
| Doba běhu benchmarku | 44,0 s | 24,5 s | **12,3 s** |
| Průchodnost výstupních tokenů | 34,1 tok/s | 61,3 tok/s | **122,2 tok/s** |
| Celková průchodnost tokenů | 157,1 tok/s | 282,6 tok/s | **563,4 tok/s** |
| Latence na token (medián) | 247,8 ms | 48,6 ms | **36,0 ms** |
| Čas do prvního tokenu (medián) | 6,9 s | 17,2 s | 6,9 s |

Rozdíl je výrazný. Rackový server se dvěma RTX 4090 zvládl stejnou práci **3,6× rychleji** než GB10, a při čistě sekvenčním generování — tedy když u obrazovky sedí jeden člověk a čeká na odpověď — jsme na starším serveru se čtyřmi RTX 3090 měřili až sedminásobek propustnosti GB10. Latence na token přes 240 ms znamená, že text „naskakuje" citelně pomaleji, než jsou dnes uživatelé zvyklí.

Jeden údaj z tabulky ale vyčnívá jinam: **čas do prvního tokenu**. Zde si GB10 vedl výrazně lépe než náš server se čtyřmi RTX 3090 (6,9 s proti 17,2 s v mediánu). Rozdělení modelu přes čtyři karty s sebou nese komunikační režii, kterou jednočipový GB10 nemá. Pro krátké, interaktivní dotazy je to znatelný rozdíl v pocitu odezvy — a dobrá ukázka toho, proč nemá smysl posuzovat hardware podle jediného čísla.

## OCR a zpracování dokumentů: kde ARM zabolel

Zpracování dokumentů je u inteligentních asistentů obvykle větší problém než samotný model. Tady jsme narazili na nejzajímavější zjištění celého testu — a nemá nic společného s výkonem.

**Tesseract na CPU** běžel na GB10 konstantně o **20–25 % rychleji** než ve stejné konfiguraci na našem x86 serveru. Solidní výsledek, žádné překvapení.

**PaddleOCR na CPU** byl na GB10 naopak **více než pětkrát pomalejší**. Důvod není v křemíku: PaddleOCR dlouhodobě nemá nativní podporu pro architekturu arm64, takže se musel spustit přes emulační vrstvu. A emulace zkrátka nevyužije prostředky efektivně.

**PaddleOCR na GPU** pak na GB10 doběhl asi **5× rychleji než nejlepší CPU výsledek** napříč všemi testovanými stroji. To je přesně to zrychlení, které od akcelerace na GPU čekáte.

Poučení z toho není „GB10 je pomalý na OCR". Poučení je, že **na ARM platformě je dostupnost softwaru stejně důležitá jako výkon**. Když polovina vašeho zpracovatelského řetězce nemá arm64 build, nejvýkonnější čip světa vám nepomůže. Tohle je věc, kterou v katalogovém listu nenajdete a zjistíte ji jedině tím, že stroj skutečně zapojíte a rozjedete na něm svůj vlastní stack.

## Unified memory: elegantní řešení s tvrdým stropem

Sdílená paměť GB10 na první pohled vypadá jako velká výhoda — 121 GiB, se kterými může model volně disponovat, žádné žonglování s tím, co se vejde do VRAM.

V praxi je ale potřeba počítat. Jazykový model Qwen3.6-27B spolu s embedding modelem Qwen3-Embedding-8B zabraly přibližně **92 GiB**. Zbylo tedy asi 29 GiB — a do nich se měl vejít aplikační worker, vyhledávací engine, uživatelské rozhraní a parsování dokumentů. Nevešly se. Při souběžném zpracování většího objemu dat stroji docházely zdroje a **zamrzal**; data jsme nakonec museli zpracovat mimo něj.

Zásadní je, že paměť je *sdílená*. Modelu tak reálně zůstává okolo 96 GB — tedy přesně tolik, kolik má náš starší server se čtyřmi RTX 3090 ve VRAM. Deklarovaná kapacita zní lépe než to, co z ní nakonec pro model zbyde, protože o ni soupeří všechno ostatní.

Reálná a nesporná výhoda GB10 leží jinde: je to **architektura Blackwell**. Rozjedete na ní nejnovější kvantizační formáty a funkce vázané na nové CUDA capabilities, které starší karty prostě neumí. To je pro nás, co zkoumáme to nejnovější na trhu, cenné — ověřujeme na ní věci, které na starším hardwaru nejdou vyzkoušet vůbec, a provozem kvantizovaných modelů bychom přece jen mohli nějakou část RAM ušetřit pro zbytek aplikace.

## Cena, protože o tu tady jde

Dosud jsme možná nevzbudili žádné velké nadšení z neočekávaných výsledků. Jenže do rovnice patří ještě tohle číslo: **DELL Pro Max s GB10 stojí aktuálně řádově něco málo přes 100 000 Kč bez DPH.**

To je cena nižší, než cena standardního rackového GPU serveru. Za tyhle peníze dostanete stroj, který se vejde do dlaně, na stůl si ho postaví jeden vývojář, utáhne na něm 27B model s 96 GB paměti pro model a umí nejnovější Blackwell featury. Z pohledu „výkon za korunu u vývojářského stolu" je to velmi zajímavá nabídka.

Nemění to ale nic na tom, co jsme naměřili u produkčního provozu. Nízká cena nekompenzuje pětinásobně pomalejší latenci na token ani skutečnost, že stroji při souběhu služeb došla paměť. Pro kompletní provoz inteligentních asistentů v on-prem, zatím musíme stále používat robustnější stroje.

dell-hand.jpg

## Co chystáme dál

Testování tímto pro nás nekončí — naopak nás začala zajímat další možnost, která se jeví jako výrazně slibnější cesta k plně on-premise provozu.

Připravujeme test **dvou strojů DELL Pro Max s GB10 propojených vysokorychlostní linkou do clusteru**, s jasným rozdělením rolí: cluster obsluhuje **výhradně jazykové modely**, zatímco aplikační vrstva, vyhledávání a zpracování dokumentů zůstanou na stávajících serverech v naší infrastruktuře.

Tímhle rozdělením adresujeme přesně to, co v prvním testu selhalo. Modelu přestane paměť ukrajovat všechno ostatní, protože nic ostatní na stroji neběží. Dva stroje zdvojnásobí dostupnou paměť i výpočetní kapacitu pro inferenci. A investice zůstane díky ceně jednotlivých strojů v rozumných mezích i ve dvojici.

Jak to dopadne, ještě nevíme — proto to měříme. Nechte se překvapit.

## Co si z toho odnést

Náš závěr je jednoznačný: **DELL Pro Max s GB10 je výborná vývojářská AI pracovní stanice a zatím nevhodný produkční server pro provoz uživatelské platformy.**

**Kdy má smysl:** vývojář nebo datový tým, který potřebuje lokálně pracovat s velkými modely, ladit prompty a řetězce, ověřovat nové kvantizace, mít AI kapacitu na stole a data pod kontrolou. V téhle roli je stroj skvělý — tichý, kompaktní, s pamětí, jakou v běžné pracovní stanici nenajdete.

**Kdy nemá smysl:** provoz asistenta pro desítky uživatelů, souběh více služeb na jednom stroji, zpracování většího objemu dokumentů, cokoli, co má mít předvídatelnou odezvu pod zátěží. Na to potřebujete klasický GPU server s dedikovanou VRAM — a jak vidíte z tabulky, dobře postavený rackový stroj s dvěma kartami zůstává v tomto ohledu výrazně napřed. Otevřenou otázkou zůstává varianta popsaná výše: několik GB10 v clusteru, které dělají jen inferenci a nic jiného.

A obecnější poznatek, který platí nad rámec tohoto jednoho stroje: **on-premise AI nestojí a nepadá je na výkonu LLM.** Důležitá je architektura celého systému a to, co se stane, když všechny komponenty poběží najednou. Právě proto si každý nový hardware, který zákazníkům doporučujeme, nejdřív měříme sami a na vlastním stacku.

---

*Uvažujete o provozu jazykových modelů a inteligentního asistenta ve vlastní infrastruktuře? Rádi vám pomůžeme navrhnout řešení, které bude odpovídat vašemu skutečnému provozu. [Ozvěte se nám.](https://www.datera.cz/kontakt)*

Václav Kašpar
Václav Kašpar 31. 7. 2026