Întrebarea „ce calculator îmi trebuie ca să rulez un LLM local" primește, de obicei, două răspunsuri greșite: „orice laptop merge" și „îți trebuie o placă video de 10.000 de lei". Adevărul este o regulă de calcul simplă, pe care o poți face pe un șervețel, plus o decizie despre lățimea de bandă a memoriei pe care aproape nimeni nu o menționează. Articolul de față îți dă regula, tabelul cu ce încape în 8, 16, 24, 32 și 128 GB, comparația reală între hardware-ul disponibil în 2026 și, la final, alegerea dintre LM Studio și Ollama, cele două unelte cu care vei rula efectiv modelele.
Motivele pentru care rulezi un model local, confidențialitatea datelor, GDPR, costul predictibil, licențele modelelor, sunt tratate separat în ghidul despre LLM local cu Ollama, privacy și self-hosting. Aici presupunem că ai decis deja și vrei să știi pe ce rulezi.
Regula de calcul: parametri, biți și un plus de 20%
Un model lingvistic este, din punctul de vedere al memoriei, o listă foarte lungă de numere numite parametri. Fiecare parametru ocupă un anumit număr de biți, în funcție de precizia la care este stocat. De aici rezultă formula pe care merită să o ții minte: memoria pentru greutăți ≈ numărul de parametri × biți per parametru ÷ 8. Ghidul de dimensionare publicat de AiCybr în august 2026 folosește exact această formulă și ajunge la aceleași ordine de mărime pe care le vezi în practică.
| Precizie | Ocupare per miliard de parametri | Model de 8B | Model de 32B | Model de 70B |
|---|---|---|---|---|
| FP16 / BF16 (originalul) | ~2 GB | ~16 GB | ~64 GB | ~140 GB |
| Q8 (8 biți) | ~1 GB | ~8 GB | ~32 GB | ~70 GB |
| Q4_K_M (~4,8 biți în practică) | ~0,6 GB | ~5 GB | ~19 GB | ~40 GB |
Cifrele de mai sus sunt doar greutățile. Peste ele se adaugă două lucruri. Primul este un supliment de aproximativ 15–20% pentru activări, tampoane și motorul de inferență. Al doilea, mult mai variabil, este cache-ul KV: memoria în care modelul păstrează cheile și valorile pentru fiecare token din conversație, ca să nu le recalculeze. Cache-ul crește liniar cu lungimea contextului și cu numărul de cereri simultane. Concluzia din ghidul citat merită repetată: un model care încape la 8.000 de tokeni de context poate să nu mai încapă la 64.000, cu aceeași cuantizare. Dacă lucrezi cu documente lungi sau cu agenți care acumulează istoric, contextul contează adesea mai mult decât diferența dintre Q4 și Q5.
Cuantizarea, adică stocarea parametrilor pe mai puțini biți, este cea care face totul posibil pe hardware de consum. Q4_K_M a devenit standardul comunității pentru un motiv: pierderea de calitate față de original este, pentru majoritatea sarcinilor, greu de observat, iar memoria scade de peste trei ori. Q8 este alegerea când vrei fidelitate maximă și ai loc; sub Q4 (Q3, Q2) degradarea devine vizibilă, mai ales la modelele mici. Diferența dintre a rula un model care „încape" și a rula unul care răspunde corect și repede stă în alegerea cuantizării, a contextului și a formatului de fișier, exact dimensionarea realistă pe care o parcurge modulul dedicat GGUF, q4_K_M vs q8_0 și hardware din cursul LLM-uri locale cu Ollama.
Tabelul: ce încape în 8, 12, 16, 24, 32, 48 și 128 GB
Tabelul de mai jos reunește regula de calcul cu practica. „Confortabil" înseamnă Q4 cu context de câteva mii de tokeni și fără compromisuri; „la limită" înseamnă cuantizare mai agresivă sau descărcare parțială în memoria sistemului, cu viteză redusă.
| Memorie disponibilă modelului | Confortabil | La limită |
|---|---|---|
| 8 GB | 7B–8B | 12B–14B cu cuantizare agresivă |
| 12 GB | 12B–14B | ~20B |
| 16 GB | 14B–20B | 24B–32B la Q3–Q4 strâns |
| 24 GB | 30B–32B | mai mari, cu descărcare pe CPU |
| 32 GB | 32B la calitate mai bună sau context lung | 70B puternic cuantizat |
| 48 GB | 70B la Q4 devine realist | precizie mai mare sau context lung |
| 128 GB | 70B–100B la calitate înaltă | 150B–200B cuantizate |
Două observații care schimbă decizia de cumpărare. Prima: modelele de tip „amestec de experți" (MoE) au mulți parametri în total, dar activează doar o parte la fiecare token; ele au nevoie de memorie pentru toți parametrii, dar rulează cu viteza unui model mult mai mic. A doua: pentru majoritatea sarcinilor de birou, cod și RAG, un model bun de 8B–14B în 2026 este surprinzător de capabil, iar saltul la 30B se simte mai mult la raționament complex decât la sarcinile zilnice. Comparăm ce oferă modelele open-weight actuale, cum sunt cele analizate în articolul despre GLM-5.2 și contextul de un milion de tokeni și în analiza DeepSeek, înainte de a decide că îți trebuie 70B.
Lățimea de bandă: cifra pe care o ignoră toată lumea
Capacitatea memoriei spune ce model încape. Lățimea de bandă a memoriei spune cât de repede răspunde. La generarea de text, modelul citește practic toate greutățile pentru fiecare token produs, deci limita superioară a vitezei este aproximativ lățimea de bandă împărțită la dimensiunea modelului în memorie. Un model de 20 GB pe o memorie de 1.800 GB/s nu poate depăși, teoretic, circa 90 de tokeni pe secundă; același model pe 270 GB/s este plafonat la aproximativ 13. Cifrele reale sunt mai mici, dar raportul se păstrează.
De aici rezultă cele două familii de hardware și compromisul dintre ele:
Plăci video discrete: bandă uriașă, memorie limitată
Seria GeForce RTX 50 a NVIDIA, lansată pe parcursul lui 2025, rămâne referința pentru inferență rapidă pe Windows și Linux, cu toate motoarele populare optimizate pentru CUDA. Specificațiile relevante, conform fișei seriei:
| Placă | Memorie | Lățime de bandă | Preț de listă la lansare (SUA) |
|---|---|---|---|
| RTX 5060 Ti | 8 sau 16 GB GDDR7 | 672 GB/s | 379 / 429 USD |
| RTX 5070 | 12 GB GDDR7 | 672 GB/s | 549 USD |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | 749 USD |
| RTX 5080 | 16 GB GDDR7 | 960 GB/s | 999 USD |
| RTX 5090 | 32 GB GDDR7 | 1.792 GB/s | 1.999 USD |
Lecția din tabel: pentru LLM-uri, memoria bate puterea de calcul. O RTX 5060 Ti de 16 GB rulează aceleași modele ca o RTX 5080 de 16 GB, doar mai încet; o RTX 5070 de 12 GB, deși mai scumpă decât 5060 Ti, rulează modele mai mici. Varianta de 8 GB a oricărei plăci este de evitat pentru acest scop. RTX 5090, cu 32 GB, este cea mai rapidă opțiune de consum pentru modele de până la 32B și pentru context lung, dar nu ajunge la 70B fără cuantizare severă sau descărcare pe CPU. Prețurile de piață în 2026 sunt, la vârful gamei, sensibil peste cele de listă.
Memorie unificată: capacitate mare, bandă mai mică
A doua familie sunt sistemele în care procesorul și unitatea grafică împart aceeași memorie, deci „VRAM-ul" este, practic, memoria sistemului.
- Apple Mac Studio (M5 Max și M5 Ultra), anunțat în august 2026. Conform specificațiilor Apple, M5 Max oferă între 36 și 128 GB de memorie unificată la 460–614 GB/s, iar M5 Ultra pornește de la 96 GB și urcă la 256 sau 512 GB, cu 1,2 TB/s. Combinația dintre capacitate și bandă este, în 2026, cea mai bună pentru a rula interactiv modele de 70B și peste, pe un singur sistem, cu MLX ca motor nativ.
- NVIDIA DGX Spark, un sistem compact cu cip GB10 Grace Blackwell, 128 GB de memorie unificată și, conform paginii NVIDIA, o lățime de bandă de 273 GB/s, cu inferență anunțată pentru modele de până la 200 de miliarde de parametri. Este alegerea potrivită când ai nevoie de ecosistemul CUDA, de fine-tuning local sau de containerele NVIDIA, mai puțin când vrei viteză maximă de generare la 70B.
- AMD Ryzen AI Max+ 395, întâlnit în mini-PC-uri și în Framework Desktop, cu până la 128 GB LPDDR5X unificată pe o magistrală de 256 de biți, adică aproximativ 256 GB/s teoretic, conform materialului tehnic AMD. Raportul capacitate/preț este cel mai bun din listă pentru modele de 30B–35B; la 70B, modelul încape, dar viteza de generare devine incomodă pentru uz interactiv.
Regula practică: dacă vrei modele de 70B+ cu răspuns fluent, ai nevoie și de capacitate, și de bandă, ceea ce înseamnă Mac Studio Ultra sau mai multe plăci video; dacă vrei 8B–32B cât mai rapid, o placă discretă de 16–32 GB câștigă; dacă vrei capacitate mare la buget mic și accepți viteză mai mică, memoria unificată AMD sau DGX Spark.
Și laptopul pe care îl ai deja?
Un laptop cu 16 GB de RAM și fără placă dedicată rulează un model de 7B–8B la Q4 pe procesor, cu viteză acceptabilă pentru chat și rezumate. Un MacBook cu 24–36 GB de memorie unificată urcă la 14B–20B confortabil, iar MLX face Apple Silicon una dintre cele mai bune platforme portabile pentru acest scop. Un laptop Windows cu RTX de 8 GB este limitat la modele mici pe GPU, dar poate descărca straturi în RAM. Înainte de a cumpăra ceva, instalează una dintre uneltele de mai jos și încearcă un model de 8B: pentru multe cazuri de utilizare, este suficient.
LM Studio vs Ollama: aceeași bază, două filosofii
Ambele unelte rulează, sub capotă, motorul llama.cpp pentru fișiere GGUF și, pe Apple Silicon, motorul MLX. Diferența nu este de performanță brută, ci de public și de mod de lucru.
LM Studio: stația de lucru cu interfață
LM Studio este o aplicație desktop cu interfață grafică, în care cauți modele, le descarci, le compari, ajustezi parametrii vizual și discuți cu ele. Este dezvoltată de Element Labs, nu este open-source ca aplicație, dar, conform anunțului din 8 iulie 2025, este gratuită și pentru utilizare la locul de muncă, fără licență comercială separată; funcțiile de administrare a echipei (SSO, restricționarea modelelor și a serverelor MCP) fac obiectul unui plan Enterprise. Aplicația expune un server local compatibil cu API-ul OpenAI, iar utilitarul de linie de comandă lms, publicat sub licență MIT, permite încărcarea modelelor, pornirea serverului și rularea fără interfață, inclusiv ca proces de fundal.
Potrivită pentru: explorarea și evaluarea modelelor, utilizatori care preferă interfața grafică, Mac-uri pe care vrei MLX fără configurare, echipe non-tehnice care au nevoie de un chat local.
Ollama: serviciul pentru developeri
Ollama este un proiect open-source sub licență MIT, disponibil pe macOS, Windows, Linux și ca imagine Docker, gândit ca un serviciu care rulează în fundal și răspunde la cereri prin API. Din iulie 2025 are și o aplicație desktop cu interfață pe macOS și Windows, dar identitatea lui rămâne linia de comandă și API-ul. Conform documentației oficiale, expune un endpoint compatibil OpenAI la adresa locală /v1, cu chat, completions, embeddings, listarea modelelor și suport pentru unelte, streaming și imagini, ceea ce înseamnă că orice bibliotecă scrisă pentru API-ul OpenAI funcționează local prin simpla schimbare a adresei. Fișierul Modelfile descrie un model personalizat (prompt de sistem, parametri), iar serverul gestionează cereri concurente, esențial când mai mulți utilizatori sau mai mulți agenți lovesc același model. Pe Apple Silicon, blogul Ollama documentează motorul MLX (în previzualizare din martie 2026, cu îmbunătățiri majore în iunie 2026), iar din 2025 proiectul oferă opțional și modele găzduite în cloud, cu planuri plătite pe consum din august 2026. Modelele cloud sunt o opțiune, nu o obligație: instalarea implicită rămâne complet locală.
Potrivită pentru: integrare în cod, containere și servere, agenți care au nevoie de un endpoint stabil, mai mulți utilizatori simultan, automatizări.
Cum alegi, în trei întrebări
- Scrii cod care vorbește cu modelul, sau vorbești tu cu modelul? Cod, servere, Docker: Ollama. Explorare, chat, comparații vizuale: LM Studio.
- Ai nevoie de cereri concurente? Un agent cu mai multe fire, un chatbot intern pentru zece colegi, un pipeline RAG: Ollama.
- Ești pe Mac și vrei rezultate imediat? Ambele au MLX în 2026; LM Studio îl expune fără configurare, Ollama îl aduce în serviciu.
Cea mai comună configurație în echipele care lucrează serios cu modele locale este să le folosească pe amândouă: LM Studio pentru a testa și alege modelul, Ollama pentru a-l servi aplicațiilor. Nu se exclud; pot rula pe același calculator, cu fișierele de model descărcate separat.
Configurații recomandate pe scenarii
Recomandările de mai jos nu conțin prețuri în lei, pentru că variază săptămânal; conțin criteriile pe care le verifici în ofertă.
- Chat și rezumate personale, buget minim. Laptopul existent cu 16 GB RAM; model de 7B–8B la Q4; LM Studio. Nu cumperi nimic.
- Developer individual, cod și RAG local. Placă video cu 16 GB (RTX 5060 Ti 16 GB sau 5070 Ti) sau Mac cu 32–48 GB unificată; modele de 14B–32B; Ollama ca serviciu, LM Studio pentru testare. Particularitățile indexării documentelor în română, cu OCR și diacritice, sunt în ghidul despre RAG pe documente românești.
- Echipă mică, chatbot intern pe documente proprii. Un server cu RTX 5090 (32 GB) sau două plăci de 16–24 GB, ori un Mac Studio cu 96 GB+; model de 32B la Q4 sau 70B la Q4 pe Mac; Ollama în Docker, cu concurență configurată; monitorizarea cache-ului KV la context lung.
- Cercetare, fine-tuning, modele de 70B+. Mac Studio M5 Ultra cu 256–512 GB pentru inferență interactivă, sau DGX Spark dacă ai nevoie de CUDA și de fluxuri de fine-tuning. Când merită fine-tuning-ul și când nu, am analizat în articolul dedicat; parcursul practic, cu LoRA/QLoRA și evaluare, este în cursul Fine-tuning modele AI.
Când sistemul depășește un singur calculator, cu mai multe modele, rutare între local și cloud, cache și limite de cost, intri în teritoriul arhitecturii de sistem, tratat în cursul Arhitectura sistemelor AI la scară.
Ce nu rezolvă hardware-ul: licențe, date și responsabilitate
Rularea locală elimină transferul datelor către un furnizor, ceea ce simplifică analiza GDPR, dar nu o elimină: logurile conversațiilor, documentele indexate pentru RAG și rezultatele generate sunt tot date pe care le prelucrezi și pentru care rămâi responsabil. Modelele open-weight vin cu licențe diferite, de la Apache 2.0 și MIT la licențe comunitare cu condiții proprii, care se aplică indiferent unde rulezi modelul. Iar dacă expui un asistent conversațional clienților, obligațiile de transparență din AI Act se aplică la fel ca pentru un model din cloud. Toate cele trei subiecte sunt detaliate în ghidul despre privacy și self-hosting linkat la începutul articolului; le menționăm aici pentru că „e local, deci nu am obligații" este cea mai frecventă concluzie greșită pe care o auzim.
Pentru comparație cu abonamentele la modelele din cloud, analiza costurilor lunare pe AI în 2026 arată punctul de la care investiția în hardware se amortizează pentru un utilizator intens.
Întrebări frecvente
Câtă memorie video îmi trebuie pentru un model de 7B?
Aproximativ 5 GB pentru greutăți la cuantizare Q4_K_M, plus cache-ul de context și un supliment de 15–20% pentru motor. O placă de 8 GB este suficientă pentru context scurt; 12–16 GB îți dau loc pentru context lung sau pentru un model de 12B–14B.
Pot rula un model de 70B pe un calculator obișnuit?
La cuantizare Q4, un model de 70B are nevoie de aproximativ 40 GB doar pentru greutăți. Încape într-un sistem cu memorie unificată de 64–128 GB (Mac, AMD Ryzen AI Max+, DGX Spark) sau pe două plăci video de 24–32 GB. Viteza depinde de lățimea de bandă: pe un Mac Studio Ultra este fluentă, pe sistemele cu aproximativ 256–273 GB/s devine lentă pentru uz interactiv.
Contează mai mult memoria sau lățimea de bandă?
Memoria decide ce model încape; lățimea de bandă decide cât de repede răspunde. Alegi întâi memoria pentru modelul dorit, apoi cea mai mare lățime de bandă pe care ți-o permite bugetul. Pentru un model de dimensiune fixă, viteza de generare este limitată aproximativ de raportul dintre lățimea de bandă și dimensiunea modelului în memorie.
LM Studio este gratuit pentru firme?
Da. Conform anunțului producătorului din iulie 2025, aplicația este gratuită și pentru utilizare la locul de muncă, fără licență comercială separată. Funcțiile de administrare a echipei (SSO, restricționarea modelelor și a serverelor MCP) fac obiectul unui plan Enterprise separat.
Ollama trimite date în cloud?
Instalarea implicită rulează complet local și nu trimite conținutul conversațiilor nicăieri. Modelele cloud oferite de proiect din 2025 sunt o funcție opțională, pe care o activezi explicit când vrei modele mai mari decât încap pe hardware-ul tău; dacă nu o folosești, datele rămân pe calculatorul tău.
Pot folosi LM Studio și Ollama în același timp?
Da. Multe echipe folosesc LM Studio pentru a testa și compara modele și Ollama pentru a le servi aplicațiilor, pe același calculator. Fiecare își descarcă propriile fișiere de model, deci vei ocupa spațiu pe disc de două ori pentru modelele pe care le folosești în ambele.
Concluzie
Dimensionarea unui LLM local se reduce la o formulă, parametri înmulțit cu biți împărțit la opt, la un supliment pentru context și motor, și la o decizie despre lățimea de bandă. În 2026, o placă video de 16 GB acoperă majoritatea nevoilor unui developer, 32 GB deschid modelele de 32B cu context lung, iar 70B+ cu răspuns fluent cer memorie unificată cu bandă mare sau mai multe plăci. LM Studio și Ollama rulează aceleași modele pe același motor; primul este stația de lucru cu interfață, al doilea serviciul pentru cod și servere, și cel mai des le vei folosi pe amândouă. Înainte de orice achiziție, testează un model de 8B pe ce ai deja: de multe ori, este exact ce îți trebuie.
Articol informativ, redactat la 8 septembrie 2026 pe baza surselor citate, consultate la această dată. Specificațiile și prețurile de listă sunt cele publicate de producători la data redactării; prețurile de piață variază. Nu constituie consultanță juridică; obligațiile privind datele și licențele depind de situația concretă.
Cursul care continuă acest articol
LLM-uri Locale cu Ollama: Privacy, Self-Hosting și Inferență Offline
Ai citit teoria. În curs o aplici: lecții structurate pe module, exerciții și quiz-uri cu feedback imediat, Profesorul AI integrat în fiecare lecție și progres salvat automat. La final primești o atestare privată de finalizare.
Din programa cursului
- De Ce LLM Local: Privacy, Data Residency și Cadrul Legal ca Motoare de Adopție
- Instalare și Fundamente Ollama: Primul Model și API-ul REST OpenAI-Compatible
- Peisajul Modelelor Open-Weight 2026: Criterii Reale de Alegere
- Cuantizare și Hardware: GGUF, q4_K_M vs q8_0 și Dimensionare Realistă
+ încă 7 module în programa completă
499 lei pe lună pentru acest curs, TVA 21% inclus · sau 1.999 lei pe lună pentru toate cele 25 de cursuri IT Pro.
Abonament lunar, cu reînnoire automată · anulezi oricând din contul tău · conținut digital cu acces imediat, vezi condițiile de retragere. Atestarea confirmă parcurgerea cursului și este privată — nu este diplomă și nu este calificare recunoscută de stat.