Domnívám se, že tímto článkem významně přispěji potenciálním kupcům do rozhodovacího procesu. Tento článek není investiční radou ze zákona, ani doporučením nákupního chování.
Nezáleží vám na spotřebě?
Pokud vám nezáleží na spotřebě, tak cokoliv v nízké cenové relaci, co má 16GB a více videopaměti (VRAM) vám bude stačit a bude to v pohodě. Takže Intel Arc PRO B50, Intel Arc Pro B60, Geforce RTX 3060Ti 12GB, 16GB nvidie, 24GB Nvidie počínajě RTX 3090 budou skvělá volba, ale při ročním používání si to zaplatíte na elektřině. Dále se používají Mac pro M4 s 48GB a více pamětí a pokud neřešíte vůbec peníze, tak Nvidia DGX je směr, kterým byste se měli ubírat při výběru železa, které bude mít výkon.
Chcete aby se vám karta za rok navrátila na ušetřené elektřině?
Za rok to sice nebude, bude to možná odhadem za rok a půl oproti RTX 3090 24GB, nicméně pokud u Nvidia A2 16GB snížíte TDP na 40 Wattů, karta vás odmění následujícím výkonem.
Testy a výsledky
Vždy když vybírám kartu, zajímá mě:
1. Cena
2. Spotřeba
3. Rychlost: kolik tokenů za vteřinu to píše. Považuji od 5 tokenů a víc za použitelné pro základní použití a od nějakých 10 – 12 tokenů za vteřinu to považuji použitelné na běžnou práci. Nepočítám do doby generování Thinking část, která samozřejmě může trvat déle.
Neřešme teď kvalitu generovaných odpovědí. U karet se 16GB jsme rádi, že se nám to „vůbec“ do karty vleze. Vždy jsem povoloval maximum GPU offloadu, co mi LM studio nabízelo.
| LMStudio Nvidia A2 16GB TDP 40W | Kolik tokenů za vteřinu |
| Unsloth/gemma-3-12-b-it (7.17GB) | 12,63 tok/sec |
| Gemma 3 27B Instruct Qat (11.33GB) | 3,63 tok/sec |
| openai-gpt-oss-20B-claude-4.5-opus (14.23GB) – thinking | 21.89 tok/sec |
| qwen3.5-27b-claude-4.6-opus-reasoning-distilled (11.24GB) | 3,69 tok/sec |
| liquid/LFM2-24B-A2B (13.43GB) | 37,2 tok/sec |
| qwen2.5-coder-7b-instruct (4.70GB) | 22,28 tok/sec |
| bartowski/Qwen2.5-Coder-32B-Instruct-GGUF (14.39GB) Q3_K_S | 3,03 tok/sec |
| mistral-nemo-2407-12b-thinking-claude-gemini-gpt5.2 (7.34GB) | 15.95 tok/sec |
| Qwen3-4b (2.57GB) (thinking) | 35.33 tok/sec |
| Qwen2.5-Coder-14B-Instruct-Q6-K-GGUF (12.12GB) | 8.29 tok/sec |
| gemma-3-27b-it-abliterated (13.84GB) | 3.84 tok/sec |
Abych to shrnul, tak 27B modely u Q3 kvantizace vnímejme spíš jako „jede to, ale zázraky od toho nečekejte“. Q4 používejte, když vám chybí paměť a z nějakého důvodu potřebujete větší model a větší kontext. Q6, pokud máte už nějakou volnou VRAM, ale chcete mít už opravdu jeden z nejlepších poměrů kvality odpovědí. Q8_0 už se vám nemusí do 16GB grafiky vlézt. A Q16 si většina z vás nepustí jinak, než na procesoru, pomale. Optimální poměr pro 16GB grafiky vidím někde mezi 7B – 14B modely, podle toho, jakou potřebujete rychlost. 27B modely bych používal až u 24GB karet.
Teploty a chlazení
Tohle je největší nevýhoda. Karta je stavěná do 2U serverů, zabírá 1 PCI-SLOT pozici a nemá ventilátor, takže si buď musíte zezadu za kartu připevnit 40mm ventilátor, který bude hlučný, nebo si na 3D tiskárně vytisknout „redukci“ na 40,60,80,92,120mm ventilátor a tady nastává kámen úrazů. Moje základní deska Asus Prime B550 plus má ramky příliš blízko této kartě, takež ani krátká 80mm ani dlouhá 120mm redukce se mi tam nevešla a musel jsem si z dalších plastů udělat „prodloužení“ air tunelu do karty pro 120mm ventilátor, aby byl ventilátor umístěn až za RAMkami a nikde mu tedy nic po cestě nevadilo. Když už jsem měl vytištěnou 80mm redukci, tak jsem připevnil z venku skříně druhý ventilátor na 80MM na výfuk ohřátého vzduchu, který do karty vhání uvnitř skříně 120mm ventilátor. A protože karta je celá pokrytá kovovým …pouzdrem/chladičem (zespod je chladič, ze shora je kovové pouzdro), tak jsem vložil ještě třetí 120mm ventilátor na ofuk karty z boku a teplotyjsou v zátěži konečně takové, že se neobávám o zdraví karty.

Shrnutí výhod a nevýhod
| Výhody | Nevýhody |
| Velmi nízká spotřeba TDP 40W, jedna z nejúspornějších na trhu | Nižší výkon u 27B distilled modelů |
| Zvládne i větší modely (27B) pomale, ideální rychlost mají 12 – 14B modely | Musíte si vyřešit chlazení (3d tisk a potom to upravovat na míru nevyhovujícím rozměrům ve skříni) |
| Velmi dobrá podpora pro AI (díky cuda-llama.cpp) | Pokud ji uvaříte, nikdo vám ji nereklamuje |
| Cena z druhé ruky z německa je na úrovni Intel Arc B50 16GB, ale nebudete řešit problémy s Vulkanem a případnou nekompatibilitou některých modelů | Cena nové nedává ekonomicky vůbec smysl a za cenu nové Nvidia A2 by mělo smysl koupit 24GB Nvidia L4 z druhé ruky, jenže ta má TDP 72W, takže nebude tak výhodná |
Chlazení a ticho – na blower ventilátory úplně zapomeňte
Zkusil jsem 2 blower ventilátory připojitelné z boku. Jeden ventilátor byl na 4 pin konektoru vytažený z nějaké HP sestavy tak hlučný, že 10 let starý robotický vysavač oproti tomu byl tichá louka vysoko v horách. Když jsem ventilátor zapnul poprvé, tak mi okamžitě odfouknul veškerý viditelný prach z Geforce GT 1030 o slot níže, načež se ventilátor okamžitě stočil a zbývající prach mi fouknul přímo do obličeje. Ale teploty byly okolo 45 stupňů v zátěži. Takže uznávám, že do serverů je to dobrá záležitost. Dle této diskuse se někomu podařilo na DELL R620 rozběhat standardní grafiku (musel teda použít přídavný zdroj k jejímu napájení, nícméně karta jela).
Nebyl to jen špatný kus?
Druhý ventilátor jsem objednal z aukra. Bohužel jsem se špatně podíval a k blower ventilátoru byl 4 PIN konektor nikoliv všechny piny v 1 řadě, ale se 2 piny v řadě dohromady ve 2 řadách. Konektor jsem nakonec elegantně rozstřihl vejpůl kleštěmi tak, abych byl schopen konektory zasunout přímo do 4 PIN konektoru. Výsledek? Ventilátor jel, ale regulace byla omezená. Buď jel ventilátor na plný výkon, což bylo nesnesitelné, anebo jen tak zlehka ofukoval a i to bylo nesnesitelné a ještě to nestačilo k uchlazení Nvidia A2. Se zkušenostmi z Radeonu R9 290X, kdy jsem před více než 10 lety občas něco zahrál a karta měla při plné zátěži hluk zhruba jako zapnutý vysavač na plný výkon, jsem pohřbil řešení blower ventilátorů jednou pro vždy. Uchladilo? Ano. Dalo se u PC vydržet? Snesu hodně, ale oba ventilátory byly hlučnější, než nabootovaný 1U server značky Dell R620 v Proxmoxu v idle stavu bez zátěže. A to ještě musím poznamenat, že budu zavřený v jedné místnosti s DELL R620, který pojede v idle, než s těmito ventilátory.

Nechám ke zvážení – chlazení minerálním olejem
Já chápu, že je to pro 99% z vás blbost, nicméně spousta z vás dnes již harddisky nepoužívá a Nvidia A2 po ponoření do minerálního oleje by vlastně byla velmi dobře chlazená, zcela tichá.
Pozor, počítač mi nepostnul, když byla karta v PCI-express 4x slotu
Tady jsou důležité poznatky. Pokud si kartu koupíte a počítač vám s ní nebude bootovat, potřebujete v BIOSu vaší desky nastavit následující nastavení:
1. Above 4G decoding: Enable
2. Resize BAR: AUTO
3. legacy boot u pci-express zařízení, pokud nefungoval UEFI
Karta má standardně pci-express 8x. V 16x slotu jela v pohodě, na Asus Prime B550 plus navíc jede první pci-express 16x slot generace 4.0. Zatímco spodní Pci-express 16x jede jen v režimu 4x a generace 3. Za žádných okolností jsem kartu nerozjel ve spodním slotu. Musel jsem proto kartu dát do horního slotu, Geforce GT 1030 přesunem do pci-express 4x stejně žádný výkonnostní propad nezaznamenala. No a v horním slotu se mi nevešel ani 120mm ventilátor, ani 80mm ventilátor. Odkaz na model ke stažení pro 3D tisk zde.

Jaké modely mi připadaly TOP rychlost/kvalita?
Čtěte vždy README autorů modelu. Pokud je někde u 27B modelu napsáno, že Q3 modely dle názoru autorů jsou fakt špatné (museli na to mít hodnotící metodiku nějaké testy, kterými to prohnali a přesvědčili se za vás, že fakt dobré nejsou), raději sáhněte třeba po 12B – 14B modelech Q6 kvantizací, které autoři hodnotí jako velmi dobré. Bude to rychlé a současně dostanete dobré výsledky.

Vaše strategie obměny hardwaru
Pokud máte herní počítač, neprotáčíte ho třeba ani 8 hodin denně, tak spotřebu téměř nemusíte řešit. Máte patrně 16GB herní grafiku a na ní vám jazykový model pojede dobře. Pokud jste majitelem zařízení od Applu, rovněž nemáte důvod s dostatečným množstvím RAM na MACu, vyhlížet alternativu. Domnívám se proto, že nemalá část čtenářů se smíří s tím, že bude mít herní grafiku a na ní bude AI protáčet a je to v pořádku. Někteří z vás mohou namítnout, že místo kalkulací cen energie, si raději připlatí za pořádný kus železa a jestli za rok koupí něco úspornějšího s větším výkonem, je to též v pořádku. I kdyby za rok bylo z prodané karty jen 40% ceny, stále za ni dostanete 40% ceny zpět, kterou můžete použít do nákupu ještě něco většího/rychlejšího či úspornějšího.
Závěr a doporučení
Kvůli komplikacím s chlazením si nejsem jistý, jestli bych šel do nvidia A2 znovu. Ale kromě chlazení jsem s ní spokojen. Momentálně je tichá, ofukují ji 3 ventilátory na vstupu, výstupu a z boku. Je to překvapivě tiché. Pokud tlačíte na spotřebu, tak oproti RTX 3090 24GB s TDP 350W se vám tahle TDP 40W karta při 12 hodinách fungování denně navrátí zhruba za rok a půl na ušetřené elektřině, což dává perfektní smysl a to je důvod, na co mířím.
Pokud bych ale byl vámi a chtěl bych si ušetřit spoustu starostí, tak asi zvážím Intel Arc B50 16GB s tím, že ale musíte ve 14 denní lhůtě, než kartu nebudete mít možnost vrátit, vyzkoušet, jestli vám to rozběhá vše, co po kartě potřebujete a taky musíte počítat s TDP 70W. Ale za cenu +- 10 500 CZK v dubnu 2026, to vlastně dává smysl, protože v ceně máte blower ventilátor (tady je zase otázka, jak to bude hlučné). Domnívám se, že na provoz LLM by měla být Intel ARC B50 rychlejší, než nvidia A2, ale zaplatíte za to +30W TDP oproti nvidia A2.



