Înapoi la blog

Grok 4.6: ce aduce nou modelul xAI pentru agenți AI

Grok 4.6, lansat de xAI pe 12 august 2026, țintește agenții de lungă durată. Ce arată benchmark-urile, cât costă și pentru cine merită.

Categorii:

Grok 4.6: ce aduce nou modelul xAI pentru agenți AI

Pe 12 august 2026, xAI a lansat Grok 4.6 — la puțin peste o lună după Grok 4.5. Mesajul central al anunțului nu este „cel mai deștept model din lume", ci ceva mult mai specific: un model construit pentru agenți care rulează mult timp și pentru muncă interactivă și vizuală mai ambițioasă. În analiza de mai jos vezi ce s-a schimbat concret față de generația anterioară, ce spun cifrele raportate la lansare, cât costă în realitate și în ce situații merită să îl pui pe lista scurtă — fiecare cifră ancorată în sursă, fără nimic inventat.

Grok 4.6 — modelul xAI pentru agenți de lungă durată, lansat pe 12 august 2026

Notă: benchmark-urile, prețurile și disponibilitatea modelelor AI se schimbă de la o lună la alta. Cifrele de mai jos reflectă anunțul oficial xAI din 12 august 2026 și acoperirea de presă de specialitate de la lansare. Verifică documentația oficială a furnizorului înainte de orice decizie de buget sau de arhitectură.

Ce este Grok 4.6 și ce s-a schimbat față de Grok 4.5

Grok 4.6 este iterația care urmează după Grok 4.5, lansat pe 8 iulie 2026. Ritmul spune deja ceva despre strategia companiei: nu mai vorbim despre generații care se schimbă o dată pe an, ci despre iterații la câteva săptămâni distanță, în care fiecare pas mută o singură axă mai departe.

În formularea xAI, Grok 4.6 „construiește peste Grok 4.5, cu accent special pe agenți de lungă durată și pe muncă interactivă și vizuală mai ambițioasă". Compania descrie și metoda: modelul a trecut printr-o rundă suplimentară de antrenament mai lungă decât cea a lui Grok 4.5, folosind date generate de model și curatate special pentru raționament și concepte tehnice avansate.

Traducerea practică a acestor două fraze este mai interesantă decât par:

  • „Agenți de lungă durată" înseamnă sarcini care nu se termină într-un singur răspuns. Un agent care primește un tichet, citește codul, scrie o modificare, rulează testele, vede că pică, revine și corectează — un lanț de zeci sau sute de pași. Aici, modelele bune la răspunsuri scurte eșuează frecvent: se pierd, uită contextul inițial sau intră în bucle.
  • „Muncă interactivă și vizuală" înseamnă generarea de interfețe, dashboard-uri, prototipuri — zona în care modelul nu doar scrie cod, ci produce ceva ce trebuie să arate bine și să funcționeze la clic.
  • Datele generate de model și curatate sunt o tehnică devenită standard în industrie: în loc să cauți mai multe date umane (care se termină), generezi date sintetice de calitate pe domeniile unde vrei progres și le filtrezi riguros.

Din punct de vedere al specificațiilor, modelul păstrează o fereastră de context de 500.000 de tokeni — la fel ca predecesorul — și are un prag de cunoaștere anunțat la 1 februarie 2026. Acceptă text și imagini la intrare și produce text la ieșire.

Nivelurile de raționament: noutatea xhigh

Un detaliu tehnic care contează pentru cine construiește pe API: Grok 4.6 expune patru niveluri de efort de raționament — low, medium, high (implicit) și un nivel nou, xhigh. Logica este aceeași pe care o vedem la toți furnizorii mari în 2026: nu plătești același efort de gândire pentru o clasificare simplă și pentru o problemă de arhitectură. Un agent bine construit variază nivelul de efort în funcție de pas, nu îl fixează la maxim „ca să fie sigur".

Aceeași logică o discutăm pe larg în articolul despre modul în care efortul de raționament schimbă costul și comportamentul modelelor — mecanica e similară indiferent de furnizor.

Benchmark-uri: unde câștigă și unde pierde Grok 4.6

Aici e partea în care majoritatea articolelor de pe internet copiază tabelul furnizorului și îl prezintă ca adevăr. Merită mai multă rigoare.

Salturile față de generația anterioară

Progresul față de Grok 4.5 este real și, pe unele teste, mare:

Progresul Grok 4.6 față de Grok 4.5 pe patru benchmark-uri agentice

Benchmark Grok 4.5 Grok 4.6
Artificial Analysis Intelligence Index 56 61
DeepSWE v1.1 54% 65,9%
APEX-Agents 47,1% 57,5%
Terminal-Bench v3.0 15,7% 26%
GDPval-AA v2 (Elo) 1526 1753

Restul cifrelor raportate pentru Grok 4.6 la nivel de efort ridicat: CursorBench v3.2 — 69,9%, FrontierCode v1.1 (Extended) — 61,3%, APEX-SWE — 56,4%, AA-Briefcase — 1577 și Harvey LAB (Vals) — 15,8%.

Un avertisment necesar despre cifrele absolute: nu compara scoruri între versiuni diferite ale aceluiași benchmark. Terminal-Bench v3.0 este un test substanțial mai greu decât v2.1, pe care se raportau scoruri de peste 80% în iulie. Cei 26% de aici nu sunt o regresie — sunt un alt examen.

Cum arată față de concurență

Afirmația-titlu a xAI este că Grok 4.6 egalează GPT-5.6 Sol pe Artificial Analysis Intelligence Index — un indice agregat, nu un test unic. Pe cifrele publicate la lansare și reluate de presa de specialitate, tabloul este mai nuanțat:

Benchmark Grok 4.6 GPT-5.6 Sol (max) Claude Fable 5 (max)
Intelligence Index 61 61 62
CursorBench v3.2 69,9% 67,2% 70,5%
DeepSWE v1.1 65,9% 73,0% 70,0%
Terminal-Bench v3.0 26% 34,6% 34,1%

Citirea onestă: Grok 4.6 intră în plutonul de frontieră pe indicele agregat, dar rămâne în urmă pe testele grele de inginerie software agentică — DeepSWE și Terminal-Bench. Nu este liderul absolut. Este însă, cu o marjă considerabilă, cel mai ieftin model aflat la acest nivel de indice.

Avertismentul care nu apare în tabel

Două lucruri pe care ar trebui să le știi înainte să iei un tabel de benchmark drept criteriu de decizie:

  1. Cifrele sunt raportate de furnizor. Nu sunt rezultatul unei verificări independente pe toate liniile. Asta nu înseamnă că sunt false — înseamnă că sunt selectate de cineva cu interes în rezultat.
  2. O parte din „victorii" sunt de fapt egalități statistice. Analizele de specialitate au observat că diferențele evidențiate pe GDPval-AA v2 și pe AA-Briefcase se află în interiorul intervalelor de încredere publicate de evaluator. Cu alte cuvinte: sunt egalități, nu avansuri.

Regula practică rămâne aceeași indiferent de furnizor: benchmark-urile îți spun pe cine să pui pe lista scurtă, nu pe cine să alegi. Alegerea se face pe sarcinile tale reale.

Preț: 2 $ și 6 $, dar cu un prag important

Grok 4.6 păstrează structura agresivă de preț a generației anterioare: 2 $ per milion de tokeni de intrare și 6 $ per milion de tokeni de ieșire, cu o variantă „Fast" la dublul tarifului. La lansare, xAI a oferit și dublul consumului inclus în prima săptămână pentru Grok Build și Cursor.

Comparativ cu prețurile de listă ale modelelor concurente de vârf, diferența este substanțială: GPT-5.6 Sol este listat la 5 $ / 30 $, iar Claude Opus 5 la 5 $ / 25 $ per milion de tokeni.

Există însă un detaliu de tarifare pe care mulți îl descoperă abia pe factură: prețul se schimbă în funcție de mărimea promptului. Sub 200.000 de tokeni de prompt se aplică tarifele de bază (cu intrarea din cache la 0,50 $ per milion); de la 200.000 în sus, tarifele se dublează — iar tariful mai mare se aplică tuturor tokenilor din cererea respectivă, nu doar celor peste prag.

Pentru un agent care acumulează istoric pe parcursul rulării, asta înseamnă că factura nu crește liniar, ci face un salt în momentul în care contextul depășește pragul. Am dedicat mecanicii acestui prag și metodelor de a rămâne sub el un ghid separat: cât costă, în realitate, un agent AI cu context lung.

Ce înseamnă, practic, „agent de lungă durată"

Accentul pe agenți nu este marketing gol — schimbă felul în care evaluezi un model. Un model bun pentru conversații nu este automat bun pentru agenți, pentru că cerințele sunt diferite:

  • Consecvență pe orizont lung. După 80 de pași, agentul mai știe care era obiectivul inițial? Sau a alunecat spre altceva?
  • Recuperarea din eroare. Când o comandă eșuează, modelul citește eroarea și schimbă abordarea — sau reîncearcă la nesfârșit aceeași soluție?
  • Autoverificare. Modelul își testează rezultatul înainte să declare că a terminat? xAI pune accent explicit pe această capacitate la Grok 4.6.
  • Disciplina uneltelor. Alege unealta potrivită și îi respectă formatul, fără să inventeze parametri?

Aceste patru comportamente sunt exact ce separă un demo impresionant de un agent care poate rula nesupravegheat în producție. Dacă evaluezi Grok 4.6 pentru o utilizare agentică, testează-le explicit — nu te baza pe scorul agregat. Fundamentele acestui tip de arhitectură le detaliem în articolul despre ce sunt agenții AI și cum funcționează.

Unde este disponibil și ce contează pentru echipele din România

Conform anunțului oficial, Grok 4.6 este disponibil în Cursor și Grok Build, prin API-ul xAI și prin parteneri precum OpenRouter, Vercel și Cloudflare. Anunțul oficial nu menționează restricții regionale.

Contextul european merită totuși explicat, pentru că a fost un subiect real cu doar o lună înainte. Grok 4.5 nu a fost disponibil în niciunul dintre cele 27 de state membre UE la lansarea din 8 iulie 2026, motivul fiind conformarea cu Regulamentul (UE) 2024/1689 — EU AI Act — pentru modelele de uz general cu risc sistemic. Restricția a fost ridicată ulterior, în a doua jumătate a lunii iulie, potrivit relatărilor de presă din acea perioadă.

Verifică disponibilitatea la sursă înainte să construiești pe ea. Statutul regional al unui model se poate schimba de la o săptămână la alta, iar o dependență de un furnizor pe care nu îl poți contracta conform din România este un risc de continuitate pentru orice produs. Informațiile din acest articol au caracter general și nu constituie consultanță juridică.

Pentru orice implementare care procesează date cu caracter personal, alegerea furnizorului nu se face doar pe preț și benchmark. Contează unde se procesează datele, ce prevede contractul privind folosirea lor pentru antrenament și dacă ai o bază legală solidă în sensul GDPR. Sunt întrebări la care răspunsul se scrie înainte de primul apel de API, nu după.

Pentru cine merită Grok 4.6 — și pentru cine nu

Merită să îl pui pe lista scurtă dacă:

  • Rulezi volume mari și costul pe sarcină este o constrângere reală de business — aici avantajul de preț este cel mai vizibil.
  • Construiești agenți cu multe iterații, unde diferența dintre 6 $ și 25–30 $ per milion de tokeni de ieșire se multiplică de mii de ori pe lună.
  • Lucrezi în Cursor și vrei să compari direct, pe același repo, cu modelul pe care îl folosești azi.
  • Ai nevoie de ferestre de context foarte mari și poți structura promptul ca să rămâi sub pragul de tarifare.

Probabil nu este alegerea potrivită dacă:

  • Ai nevoie de vârful absolut pe inginerie software agentică grea — pe DeepSWE și Terminal-Bench, concurența rămâne înainte.
  • Ai un flux de lucru deja integrat profund în ecosistemul altui furnizor, iar costul migrării depășește economia.
  • Cerințele tale de conformare impun garanții contractuale specifice pe care trebuie să le verifici separat pentru fiecare furnizor.
  • Contextul tău depășește constant 200.000 de tokeni fără posibilitate de optimizare — atunci avantajul de preț se înjumătățește.

Cum îl testezi corect, în trei pași

  1. Alege cinci sarcini reale, nu exemple de demo. Ideal, sarcini pe care le-ai rulat deja cu modelul actual și pentru care știi cum arată un rezultat bun.
  2. Rulează în paralel, cu prompturi identice, pe Grok 4.6 și pe modelul tău curent. Notează trei lucruri: calitatea rezultatului, numărul de tokeni consumați și numărul de intervenții umane necesare.
  3. Calculează costul pe rezultat livrat, nu pe token. Un model cu tarif dublu care termină sarcina din prima poate fi mai ieftin decât unul ieftin care are nevoie de patru încercări. Metodologia completă de comparație o detaliem în ghidul de alegere între Grok 4.6, GPT-5.6 Sol și Claude Opus 5.

Acest test durează o zi și îți dă un răspuns mai bun decât orice tabel de benchmark.

Cum te ajută cursurile de pe Cursuri AI

Ritmul lansărilor din 2026 confirmă un lucru pe care îl repetăm des: modelele se schimbă lunar, competențele rămân. Cine știe să construiască un agent corect, să îi gestioneze contextul și să îi măsoare costul real trece de la un model la altul într-o după-amiază. Cine nu, rămâne dependent de recomandările altora.

Fiecare curs vine cu un profesor AI care răspunde la întrebări pe măsură ce parcurgi materialul, iar conținutul se actualizează pe măsură ce ecosistemul se schimbă — esențial într-un an cu lansări la câteva săptămâni distanță.

Întrebări frecvente

Î: Ce este Grok 4.6? Este modelul lansat de xAI pe 12 august 2026, succesorul lui Grok 4.5. xAI îl descrie ca fiind construit cu accent pe agenți de lungă durată și pe muncă interactivă și vizuală mai ambițioasă, după o rundă de antrenament suplimentar mai lungă decât cea a generației anterioare. Are o fereastră de context de 500.000 de tokeni și un prag de cunoaștere anunțat la 1 februarie 2026.

Î: Cât costă Grok 4.6 pe API? Tarifele de bază sunt 2 $ per milion de tokeni de intrare și 6 $ per milion de tokeni de ieșire, cu o variantă „Fast" la dublul acestor valori. Atenție la pragul de tarifare: pentru prompturi de la 200.000 de tokeni în sus, tarifele se dublează și se aplică tuturor tokenilor din cerere. Verifică pagina oficială de prețuri înainte de estimări de buget.

Î: Este Grok 4.6 mai bun decât GPT-5.6 Sol sau Claude Opus 5? Depinde de sarcină. Pe indicele agregat de inteligență al Artificial Analysis, Grok 4.6 obține 61 — la egalitate cu GPT-5.6 Sol și un punct sub Claude Fable 5. Pe testele grele de inginerie software agentică, precum DeepSWE v1.1 și Terminal-Bench v3.0, rămâne în urma ambelor. Avantajul lui clar este prețul: aproximativ o cincime din costul de ieșire al GPT-5.6 Sol.

Î: Grok 4.6 este disponibil în România? Anunțul oficial nu menționează restricții regionale, iar modelul este listat în Cursor, Grok Build, API-ul xAI și la parteneri precum OpenRouter, Vercel și Cloudflare. Precedentul contează totuși: Grok 4.5 a fost indisponibil în toate cele 27 de state UE la lansare, din motive de conformare cu EU AI Act, iar restricția a fost ridicată abia ulterior. Verifică statutul curent direct pe sursa oficială înainte de a construi pe acest model.

Î: Ce înseamnă nivelul de raționament xhigh? Este cel mai ridicat dintre cele patru niveluri de efort expuse de model (low, medium, high, xhigh). Un efort mai mare înseamnă răspunsuri mai bine gândite pe probleme dificile, dar și mai mulți tokeni consumați și latență mai mare. În practică, un sistem bine proiectat variază nivelul în funcție de dificultatea pasului, în loc să îl fixeze la maxim.

Î: Merită să migrez de la modelul pe care îl folosesc acum? Nu pe baza unui tabel de benchmark. Rulează cinci sarcini reale în paralel pe ambele modele, cu prompturi identice, și compară calitatea rezultatului, tokenii consumați și numărul de corecturi umane necesare. Decide pe costul per rezultat livrat, nu pe prețul per token.

Concluzie

Grok 4.6 nu este modelul care schimbă ierarhia. Este ceva mai interesant din perspectiva unei echipe cu buget: un model care ajunge la nivelul de frontieră pe indicele agregat, rămâne în urmă pe cele mai grele teste de inginerie și cere pentru asta o fracțiune din prețul concurenței. Pentru fluxuri agentice cu volum mare, acest raport merită testat serios.

Ce nu se schimbă este metoda. Un tabel de benchmark nu îți spune dacă un model funcționează pentru tine — asta o spune doar rularea lui pe munca ta reală, cu costul măsurat pe rezultat, nu pe token. Iar competența de a face corect acest test rămâne valoroasă indiferent de ce model se lansează luna viitoare.

Surse

Articol informativ, publicat la 13 august 2026. Cifrele de benchmark și prețurile provin din comunicarea oficială xAI și din presa de specialitate citată; valorile se pot schimba odată cu noile versiuni de model. Conținutul are caracter educativ și nu constituie consultanță juridică sau financiară.

Ți-a plăcut articolul? Lasă o apreciere sau salvează-l pentru mai târziu.
Comunitate

Întrebări & sugestii

Ce au întrebat cititorii despre acest articol — și răspunsurile echipei Cursuri AI.

Mesajele sunt verificate de un moderator înainte de publicare.

Fii primul care lasă o întrebare sau o sugestie pe acest articol.

Continuă să înveți

Aplică ce ai citit pe platformă

Cursuri interactive, exerciții practice și progres salvat. Începe cu un plan potrivit pentru tine.