Pojmy, ktoré vám pomôžu lepšie porozumieť hardvérovým požiadavkám pre AI.
Umelá inteligencia, ktorá beží výlučne na vašom vlastnom hardvéri. Na rozdiel od ChatGPT sa žiadne dáta neodosielajú na cudzie servery, čím je zaručené 100 % súkromie a bezpečnosť.
Základný "mozog" umelej inteligencie (napr. ChatGPT/GPT-5.6, Google Gemini, Claude Fable 5/Opus 5, Llama-4 či Qwen), ktorý bol natrénovaný na obrovskom množstve textu. Dokáže chápať kontext, programovať či tvoriť kreatívny obsah.
Základná stavebná jednotka textu, ktorú AI spracováva. Jeden token zodpovedá približne 4 znakom alebo 3/4 slova. Modely nepracujú s celými slovami, ale delia si ich na tieto časti.
Priekopník v komerčnej AI a tvorca celosvetovo najznámejšieho chatbota ChatGPT, ktorého vlajková verzia beží na modeli GPT-5.6 (radu Sol, Terra, Luna). Preslávil sa modelmi série GPT-4, GPT-4o a rozumovými modelmi o1 a o3. Tieto uzavreté (closed-source) modely sú prístupné cez API.
AI modely od spoločnosti Google. Zatiaľ čo ich hlavné multimodálne modely radu Gemini (Flash, Pro, Ultra) fungujú ako výkonné cloudové služby s obrovským kontextovým oknom, modely Gemma sú otvorené (open-weights) a optimalizované pre beh na lokálnom hardvéri.
Rodina modelov Claude (napr. najnovšie modely Claude Fable 5 a Claude Opus 5 či vysoko inteligentný Claude Sonnet 5) vyvinutá spoločnosťou Anthropic. Tieto uzavreté cloudové modely sa zameriavajú na vysokú mieru bezpečnosti, presné programovanie a pokročilé logické uvažovanie.
Mimoriadne rýchlo rastúci segment otvorených (open-weights) aj zatvorených modelov (napr. DeepSeek-V3/R1, Alibaba Qwen). Vyznačujú sa vysokou efektivitou výpočtov, skvelým pomerom cena/výkon a sú mimoriadne obľúbené pre lokálne nasadenie vo firmách.
Grafická karta uspôsobená na AI výpočty. Na rozdiel od procesora (CPU) má tisíce malých jadier a dokáže spracovávať milióny matematických operácií naraz, čo z nej robí motor AI.
Grafická pamäť na AI akcelerátoroch. Celý AI model a jeho výpočty sa musia zmestiť práve sem. Ide o najdôležitejší hardvérový parameter AI stanice.
Ukazovateľ (v tokenoch za sekundu), ako rýchlo AI tvorí odpovede (slová). Pri lokálnom behu priamo závisí od výkonu a šírky pásma pamäte (VRAM) vašej grafickej karty.
Veľkosť "mozgu" modelu udávaná v miliardách parametrov (Billion). Čím vyššie číslo, tým je model inteligentnejší, no vyžaduje omnoho väčšiu pamäť VRAM.
Maximálne množstvo textu, ktoré dokáže model prečítať a zohľadniť naraz v rámci jedného dopytu. Meria sa v "tokenoch" (približne slabikách alebo častiach slov).
Metóda prepojenia AI s internými súbormi firmy v reálnom čase. AI si pred odpoveďou vyhľadá informácie vo vašej databáze, čím sa predíde vymýšľaniu (halucináciám).
Proces, pri ktorom vezmete hotový LLM model a "doučíte" ho na vašich vlastných firemných dátach (napríklad na zmluvách alebo manuáloch), aby získal vašu špecifickú expertízu.
Pamäť, ktorú AI využíva na "zapamätanie si" kontextu prebiehajúcej konverzácie alebo dlhých zmlúv. S narastajúcim textom v chate KV Cache exponenciálne konzumuje VRAM.
Fáza, v ktorej už model netrénujete, ale reálne ho používate (keď odpovedá na vaše otázky alebo analyzuje dáta). Aj tento proces je náročný na výpočtový výkon a pamäť.
Kompresia modelu znížením matematickej presnosti jeho váh (napr. zo 16-bit na 4-bit). Výrazne znižuje nároky na VRAM s minimálnou stratou kvality generovania.
Štandardizovaný test na meranie schopností AI (napr. MMLU pre všeobecné vedomosti, GSM8k pre matematiku). Umožňuje objektívne porovnávať inteligenciu a rýchlosť rôznych modelov.
Populárny a užívateľsky prívetivý open-source nástroj, ktorý zjednodušuje beh lokálnych modelov (napr. Llama 3, Qwen) na osobných počítačoch a firemných staniciach. Balí modelové váhy, konfigurácie a kód do jednoducho spustiteľných balíčkov a poskytuje lokálne API rozhranie.
Vysoko výkonný a pamäťovo efektívny engine určený na prevádzku LLM modelov na produkčných serveroch a API staniciach. Využíva inovatívnu technológiu *PagedAttention* (podobnú virtuálnej pamäti v OS), čo umožňuje obsluhovať desiatky paralelne komunikujúcich užívateľov naraz s extrémnou rýchlosťou a úsporou VRAM.
Kľúčová nízkoúrovňová knižnica napísaná v čistom C/C++, na ktorej stavia veľké množstvo lokálnych AI nástrojov (vrátane Ollamy). Umožňuje spúšťať kvantizované LLM modely na bežnom hardvéri (vrátane CPU a grafických kariet rôznych výrobcov) s minimálnymi závislosťami a maximálnym výkonom.