Tariful afișat pentru GPT-6 Astra este 10 $ la intrare și 50 $ la ieșire per milion de tokeni. Factura ta, însă, nu iese din tariful acesta, ci din patru decizii de arhitectură: cât din context e servit din cache, în ce mod de rulare trimiți cererea, la ce nivel de effort lucrează modelul și de câte ori reia o sarcină până iese bine. Articolul de față pune cifrele oficiale cap la cap și le trece prin trei calcule cu ipoteze declarate, ca să poți estima înainte, nu după prima factură.
Ce primești, exact
Datele din documentația OpenAI pentru dezvoltatori, verificate la 4 septembrie 2026:
| Specificație | Valoare |
|---|---|
| Identificator | gpt-6-astra |
| Fereastra de context | 1.050.000 de tokeni |
| Intrare maximă | 922.000 de tokeni |
| Ieșire maximă | 128.000 de tokeni |
| Cunoștințe până în | 30 aprilie 2026 |
| Modalități | text și imagini la intrare, text la ieșire |
Niveluri reasoning.effort |
low, medium, high, xhigh, max |
| Capabilități declarate | streaming, ieșiri structurate, apel de funcții, căutare în fișiere, intrare de imagini, căutare web, prompt caching |
Modelul este expus pe Chat Completions, Responses, Realtime și Batch, fără nivel gratuit. Uneltele disponibile includ căutare web, căutare în fișiere, generare de imagini, interpretor de cod, shell găzduit, aplicare de patch-uri, skills, computer use, MCP și tool search.
Un lucru se vede imediat din tabel și schimbă felul în care îți proiectezi promptul: intrarea maximă (922.000) e mai mică decât fereastra de context (1.050.000). Diferența e spațiul rezervat raționamentului și ieșirii. Dacă îți construiești bugetul de tokeni pe „am un milion la dispoziție", vei lovi limita fără să înțelegi de ce. Astfel de decizii — bugetul de context, ordinea blocurilor, gestiunea erorilor, ieșirile structurate — sunt materia cursului Integrare Avansată LLM în Aplicații de Producție.
Grila completă de prețuri
| Mod de rulare | Intrare | Intrare din cache | Ieșire |
|---|---|---|---|
| Standard | 10 $ | 1 $ | 50 $ |
| Batch | 5 $ | 0,50 $ | 25 $ |
| Flex | 5 $ | 0,50 $ | 25 $ |
| Fast Mode | 20 $ | 2 $ | 100 $ |
Toate valorile sunt per milion de tokeni, în dolari. Reperul util: GPT-5.6 Sol, modelul de vârf anterior, costă 4 $ și 20 $ — deci Astra e de 2,5 ori mai scump la tariful standard. Fast Mode livrează până la 2,5× viteza standard, la dublul prețului.
Ce înseamnă asta pentru un buget lunar: aceeași sarcină poate costa între 0,5× și 2× tariful standard, fără să schimbi nimic în prompt, doar mutând-o între moduri. Sarcinile care pot aștepta câteva ore aparțin în Batch. Cele care blochează un utilizator în fața ecranului sunt singurele care justifică Fast Mode.
Trei calcule de cost, cu ipoteze declarate
Cifrele de mai jos sunt ilustrative. Ipotezele sunt scrise explicit tocmai ca să le poți înlocui cu ale tale.
1. Asistent intern pe documentație
Ipoteze: 2.000 de cereri pe zi lucrătoare; 20.000 de tokeni de context la fiecare cerere, din care 18.000 servite din cache; 1.000 de tokeni întrebarea nouă; 700 de tokeni răspunsul.
| Componentă | Calcul | Cost |
|---|---|---|
| Context din cache | 18.000 × 1 $/M | 0,018 $ |
| Intrare necache-uită | 3.000 × 10 $/M | 0,030 $ |
| Ieșire | 700 × 50 $/M | 0,035 $ |
| Total per cerere | 0,083 $ |
La 2.000 de cereri pe zi: 166 $ pe zi, aproximativ 3.650 $ pe lună la 22 de zile lucrătoare. Aceeași sarcină pe un model cu citiri din cache la 0,25 $/M — cazul lui Claude Fable 5.1 — costă 0,0695 $ per cerere, adică în jur de 3.060 $ pe lună. Diferența de aproximativ 16% vine exclusiv din tariful contextului recitit, nu din calitatea răspunsului. Comparația completă între cele două modele e în GPT-6 Astra vs Claude Fable 5.1.
2. Agent de programare, sesiune lungă
Ipoteze: o sesiune de trei ore, 120 de pași; la fiecare pas se recitesc în medie 120.000 de tokeni din cache; 4.000 de tokeni intrare nouă (rezultate de unelte); 1.500 de tokeni ieșire.
| Componentă | Calcul | Cost per pas |
|---|---|---|
| Context din cache | 120.000 × 1 $/M | 0,120 $ |
| Intrare nouă | 4.000 × 10 $/M | 0,040 $ |
| Ieșire | 1.500 × 50 $/M | 0,075 $ |
| Total per pas | 0,235 $ |
O sesiune întreagă: aproximativ 28 $. Pe un model cu citiri din cache la un sfert din preț, aceeași sesiune costă în jur de 17 $ — cu circa 38% mai puțin, tot din aceeași singură poziție din grilă. Aici se vede de ce, pentru agenți care rulează ore, structura de tarifare a contextului contează mai mult decât tariful de bază. Bugetarea completă a unui astfel de agent, cu tipare de consum și praguri de alertă, e detaliată în ghidul de cost pentru agenți cu context lung.
3. Lot de clasificare rulat peste noapte
Ipoteze: 50.000 de documente; 3.000 de tokeni intrare și 300 de tokeni ieșire fiecare; fără cache, pentru că fiecare document e diferit.
| Mod | Intrare (150M tokeni) | Ieșire (15M tokeni) | Total |
|---|---|---|---|
| Standard | 1.500 $ | 750 $ | 2.250 $ |
| Batch | 750 $ | 375 $ | 1.125 $ |
Observația onestă care încheie exemplul: pentru clasificare pe documente scurte, un model de vârf este aproape întotdeauna alegerea greșită. Rulează întâi 200 de documente pe un model din treapta de mijloc și compară acuratețea. Dacă diferența e sub pragul tău de acceptare, ai economisit un ordin de mărime.
Cache-ul: unde se decide, de fapt, factura
Toate cele trei calcule au aceeași concluzie: poziția care mișcă factura este contextul recitit. Trei reguli practice:
Prefixul trebuie să fie stabil octet cu octet. Cache-ul funcționează pe potrivire de prefix. O dată calendaristică generată la fiecare cerere, un identificator de sesiune sau o listă de unelte serializată în ordine diferită invalidează tot ce urmează. Ține la început ce nu se schimbă și pune la coadă ce variază.
Verifică, nu presupune. Dacă tokenii serviți din cache rămân zero pe cereri repetate, ai un invalidator tăcut în prompt. Nu e o problemă de model, e o problemă de ordonare.
Nu compacta din reflex. Tentația de a rezuma agresiv istoricul ca să economisești bani are un cost ascuns: fiecare compactare pierde detalii despre ce s-a încercat și de ce a eșuat. Cu contextul recitit ieftin, compromisul se schimbă. Cum se administrează corect memoria unui agent, ce se păstrează și ce se aruncă, e subiectul cursului Context Engineering și Memorie pentru Agenți AI.
Contextul de 1,05 milioane nu e uniform
Fereastra există, dar acuratețea la regăsire nu e constantă pe toată lungimea ei: analizele publicate raportează 100% în banda 256.000–512.000 de tokeni și 96,3% în banda 512.000–1.000.000, pe teste de regăsire cu mai multe „ace în carul cu fân".
Traducerea în decizii de arhitectură: umplerea ferestrei nu înlocuiește un sistem de recuperare a informației. Peste jumătate de milion de tokeni, plătești liniar mai mult și primești o probabilitate ceva mai mică să găsești exact fragmentul care contează. Pentru baze de cunoștințe mari, un RAG bine construit rămâne mai ieftin și mai fiabil decât „bag tot în prompt".
Effort: pârghia de calitate și de cost, în același loc
reasoning.effort acceptă cinci trepte, de la low la max. Fiecare treaptă schimbă simultan trei lucruri: adâncimea raționamentului, numărul de tokeni consumați și latența.
Regula de calibrare care funcționează în practică: pornește de la treapta implicită, apoi coboară, nu urca. Rulează setul tău de evaluare la high, apoi la medium, apoi la low, și oprește-te la ultima treaptă care încă trece criteriul de acceptare. Pe sarcinile de rutină — clasificare, extragere, reformulare — treptele de jos livrează practic același rezultat la o fracțiune din cost. Treptele xhigh și max își merită prețul doar acolo unde corectitudinea contează mai mult decât factura și unde ai măsurat că treapta de dedesubt nu ajunge.
Fără un set de evaluare, calibrarea asta e ghicit. Cu unul, e o după-amiază de lucru care taie durabil din factură; construirea lui e conținutul cursului AI Evals pentru LLM-uri în Producție.
Migrarea de pe GPT-5.6 Sol: lista de verificare
- Recalculează bugetul, nu îl extrapola. Tariful e de 2,5 ori mai mare. Dacă modelul consumă mai puțini tokeni de ieșire pe sarcinile tale — cum susține OpenAI că se întâmplă pe unele categorii — diferența reală va fi mai mică. Măsoară pe 30 de cazuri înainte de a muta tot traficul.
- Verifică limita de intrare. 922.000 de tokeni, nu 1.050.000. Prompturile construite până la limita teoretică vor eșua.
- Recalibrează
effort. Setarea moștenită de pe modelul anterior nu e neapărat optimul pe cel nou. - Testează cache-ul după migrare. Structura promptului s-a putut schimba fără să observi; un prefix instabil anulează economia principală.
- Mută în Batch tot ce poate aștepta. E singura reducere de 50% pe care o primești fără nicio pierdere de calitate.
- Verifică activarea pe planurile de echipă. Pe Enterprise, modelul este dezactivat implicit la lansare — administratorul spațiului de lucru trebuie să îl activeze.
- Nu presupune că accesul e garantat. Astra atinge pragul „Critical" la securitate cibernetică în cadrul intern de evaluare al OpenAI, iar capabilitățile sensibile sunt condiționate de programul Daybreak. Contextul complet e în analiza lansării.
Ce nu scrie în grila de prețuri
Monitorizarea automată poate opri sarcini legitime. Odată cu Astra, OpenAI a introdus mecanisme care detectează și întrerup acțiuni potențial neconforme în sarcinile cu unelte. Compania recunoaște că această monitorizare poate opri și muncă legitimă. Pentru un flux automat care rulează noaptea, asta înseamnă că ai nevoie de reluare controlată și de alertare, nu de presupunerea că sarcina s-a terminat.
Modelul e mai greu de auditat. OpenAI afirmă că monitorizabilitatea lui Astra a scăzut față de GPT-5.6 Sol. Nu e o problemă de facturare, dar e o problemă de guvernanță: cu cât modelul e mai greu de explicat, cu atât logarea deciziilor din sistemul tău trebuie să fie mai bună.
Costurile se decontează în valută. Pentru o firmă din România, factura de API intră în regimul de servicii intracomunitare sau din afara UE, cu implicații de taxare inversă și de raportare. Tratamentul fiscal corect al abonamentelor și al consumului de API e detaliat separat în ghidul despre abonamente AI pe firmă.
Întrebări frecvente
Î: Cât costă GPT-6 Astra în API? R: La tariful standard, 10 $ per milion de tokeni la intrare, 1 $ per milion pentru intrarea servită din cache și 50 $ per milion la ieșire. În Batch și în Flex, tarifele sunt înjumătățite (5 $ / 0,50 $ / 25 $), iar în Fast Mode sunt dublate (20 $ / 2 $ / 100 $). Nu există nivel gratuit.
Î: Care este fereastra de context reală? R: 1.050.000 de tokeni fereastră totală, din care maximum 922.000 pot fi intrare și maximum 128.000 ieșire. Acuratețea la regăsire nu e uniformă: e raportată la 100% în banda 256.000–512.000 de tokeni și la 96,3% peste 512.000, deci un sistem de recuperare a informației rămâne util chiar și cu o fereastră atât de mare.
Î: Merită trecerea de pe GPT-5.6 Sol pe Astra? R: Merită dacă sarcinile tale sunt în zonele unde saltul e real — utilizarea autonomă a calculatorului, inginerie software în sesiuni lungi, securitate — și dacă o evaluare pe 30 de cazuri reale confirmă câștigul. Pentru scriere, sinteză și clasificare obișnuită, plătești de 2,5 ori mai mult pentru o diferență mică.
Î: Cum reduc factura fără să pierd calitate?
R: În ordinea eficienței: stabilizează prefixul ca să se servească din cache, mută în Batch tot ce poate aștepta, coboară effort până la ultima treaptă care trece criteriul de acceptare și scoate din context ce nu contribuie la răspuns. Abia după toate acestea are sens discuția despre schimbarea modelului.
Î: De ce îmi apar zero tokeni serviți din cache? R: Aproape sigur ai un element variabil la începutul promptului — o dată calendaristică, un identificator de sesiune, o listă de unelte serializată în altă ordine. Cache-ul se potrivește pe prefix: orice modificare invalidează tot ce urmează după ea.
Î: Astra poate fi folosit pentru sarcini de securitate ofensivă? R: Nu în regim general. Modelul atinge pragul „Critical" la securitate cibernetică în Preparedness Framework, iar capabilitățile ofensive avansate sunt condiționate de programul Daybreak, destinat apărătorilor verificați. Pentru munca defensivă obișnuită — triaj de alerte, analiză de loguri, documentare de incidente — modelul este disponibil ca oricare altul, în limitele politicii de utilizare.
Concluzie
Grila de prețuri a lui GPT-6 Astra are patru linii, dar factura ta are patru pârghii: cache, mod de rulare, effort și numărul de reluări. Diferența dintre o integrare disciplinată și una făcută pe grabă este, în cifrele de mai sus, de ordinul zecilor de procente — mai mult decât diferența dintre doi furnizori.
Modelele se vor schimba din nou. Ce rămâne este metoda: un set de evaluare pe sarcini reale, un prefix stabil, un buget de context gândit înainte și disciplina de a măsura costul per sarcină finalizată, nu tariful de pe pagina de prețuri.
Surse
- Specificațiile modelului, capabilitățile și tarifele: documentația pentru dezvoltatori OpenAI,
gpt-6-astra. - Anunțul oficial și condițiile de disponibilitate: GPT-6 Astra: A new generation of intelligence, OpenAI, 3 septembrie 2026.
- Grila pe cele patru moduri de rulare, benzile de acuratețe pe context lung și observațiile privind monitorizarea automată: analiza eesel AI și analiza DataCamp.
- Tarifele de referință pentru modelul concurent: Introducing Claude Fable 5.1 and Claude Mythos 5.1, Anthropic, 1 septembrie 2026.
Articol informativ, redactat la 4 septembrie 2026 pe baza surselor citate, consultate la această dată. Calculele de cost sunt ilustrative și pornesc de la ipotezele scrise explicit în text; prețurile se modifică frecvent și trebuie verificate pe documentația oficială înainte de a fi folosite într-un buget.
Cursul care continuă acest articol
Integrare Avansată LLM în Aplicații de Producție
Ai citit teoria. În curs o aplici: lecții structurate pe module, exerciții și quiz-uri cu feedback imediat, Profesorul AI integrat în fiecare lecție și progres salvat automat. La final primești o atestare privată de finalizare.
Din programa cursului
- Fundamentele Integrării LLM în 2026
- Streaming și Error Handling
- Function Calling și Tool Use
- Model Context Protocol (MCP)
+ încă 5 module în programa completă
499 lei pe lună pentru acest curs, TVA 21% inclus · sau 1.999 lei pe lună pentru toate cele 25 de cursuri IT Pro.
Abonament lunar, cu reînnoire automată · anulezi oricând din contul tău · conținut digital cu acces imediat, vezi condițiile de retragere. Atestarea confirmă parcurgerea cursului și este privată — nu este diplomă și nu este calificare recunoscută de stat.