GPT-6 Astra în API: cost real, context și integrare

Cât costă efectiv GPT-6 Astra în API: grila pe cele patru moduri de rulare, trei calcule de cost și ce verifici înainte de migrarea de pe GPT-5.6 Sol.

11 minute de lectură

Tariful afișat pentru GPT-6 Astra este 10 $ la intrare și 50 $ la ieșire per milion de tokeni. Factura ta, însă, nu iese din tariful acesta, ci din patru decizii de arhitectură: cât din context e servit din cache, în ce mod de rulare trimiți cererea, la ce nivel de effort lucrează modelul și de câte ori reia o sarcină până iese bine. Articolul de față pune cifrele oficiale cap la cap și le trece prin trei calcule cu ipoteze declarate, ca să poți estima înainte, nu după prima factură.

Grila de prețuri GPT-6 Astra: standard 10 dolari intrare, 1 dolar intrare din cache, 50 dolari ieșire; Batch și Flex la jumătate; Fast Mode la dublu

Ce primești, exact

Datele din documentația OpenAI pentru dezvoltatori, verificate la 4 septembrie 2026:

Specificație Valoare
Identificator gpt-6-astra
Fereastra de context 1.050.000 de tokeni
Intrare maximă 922.000 de tokeni
Ieșire maximă 128.000 de tokeni
Cunoștințe până în 30 aprilie 2026
Modalități text și imagini la intrare, text la ieșire
Niveluri reasoning.effort low, medium, high, xhigh, max
Capabilități declarate streaming, ieșiri structurate, apel de funcții, căutare în fișiere, intrare de imagini, căutare web, prompt caching

Modelul este expus pe Chat Completions, Responses, Realtime și Batch, fără nivel gratuit. Uneltele disponibile includ căutare web, căutare în fișiere, generare de imagini, interpretor de cod, shell găzduit, aplicare de patch-uri, skills, computer use, MCP și tool search.

Un lucru se vede imediat din tabel și schimbă felul în care îți proiectezi promptul: intrarea maximă (922.000) e mai mică decât fereastra de context (1.050.000). Diferența e spațiul rezervat raționamentului și ieșirii. Dacă îți construiești bugetul de tokeni pe „am un milion la dispoziție", vei lovi limita fără să înțelegi de ce. Astfel de decizii — bugetul de context, ordinea blocurilor, gestiunea erorilor, ieșirile structurate — sunt materia cursului Integrare Avansată LLM în Aplicații de Producție.

Grila completă de prețuri

Mod de rulare Intrare Intrare din cache Ieșire
Standard 10 $ 1 $ 50 $
Batch 5 $ 0,50 $ 25 $
Flex 5 $ 0,50 $ 25 $
Fast Mode 20 $ 2 $ 100 $

Toate valorile sunt per milion de tokeni, în dolari. Reperul util: GPT-5.6 Sol, modelul de vârf anterior, costă 4 $ și 20 $ — deci Astra e de 2,5 ori mai scump la tariful standard. Fast Mode livrează până la 2,5× viteza standard, la dublul prețului.

Ce înseamnă asta pentru un buget lunar: aceeași sarcină poate costa între 0,5× și 2× tariful standard, fără să schimbi nimic în prompt, doar mutând-o între moduri. Sarcinile care pot aștepta câteva ore aparțin în Batch. Cele care blochează un utilizator în fața ecranului sunt singurele care justifică Fast Mode.

Trei calcule de cost, cu ipoteze declarate

Cifrele de mai jos sunt ilustrative. Ipotezele sunt scrise explicit tocmai ca să le poți înlocui cu ale tale.

1. Asistent intern pe documentație

Ipoteze: 2.000 de cereri pe zi lucrătoare; 20.000 de tokeni de context la fiecare cerere, din care 18.000 servite din cache; 1.000 de tokeni întrebarea nouă; 700 de tokeni răspunsul.

Componentă Calcul Cost
Context din cache 18.000 × 1 $/M 0,018 $
Intrare necache-uită 3.000 × 10 $/M 0,030 $
Ieșire 700 × 50 $/M 0,035 $
Total per cerere 0,083 $

La 2.000 de cereri pe zi: 166 $ pe zi, aproximativ 3.650 $ pe lună la 22 de zile lucrătoare. Aceeași sarcină pe un model cu citiri din cache la 0,25 $/M — cazul lui Claude Fable 5.1 — costă 0,0695 $ per cerere, adică în jur de 3.060 $ pe lună. Diferența de aproximativ 16% vine exclusiv din tariful contextului recitit, nu din calitatea răspunsului. Comparația completă între cele două modele e în GPT-6 Astra vs Claude Fable 5.1.

2. Agent de programare, sesiune lungă

Ipoteze: o sesiune de trei ore, 120 de pași; la fiecare pas se recitesc în medie 120.000 de tokeni din cache; 4.000 de tokeni intrare nouă (rezultate de unelte); 1.500 de tokeni ieșire.

Componentă Calcul Cost per pas
Context din cache 120.000 × 1 $/M 0,120 $
Intrare nouă 4.000 × 10 $/M 0,040 $
Ieșire 1.500 × 50 $/M 0,075 $
Total per pas 0,235 $

O sesiune întreagă: aproximativ 28 $. Pe un model cu citiri din cache la un sfert din preț, aceeași sesiune costă în jur de 17 $ — cu circa 38% mai puțin, tot din aceeași singură poziție din grilă. Aici se vede de ce, pentru agenți care rulează ore, structura de tarifare a contextului contează mai mult decât tariful de bază. Bugetarea completă a unui astfel de agent, cu tipare de consum și praguri de alertă, e detaliată în ghidul de cost pentru agenți cu context lung.

3. Lot de clasificare rulat peste noapte

Ipoteze: 50.000 de documente; 3.000 de tokeni intrare și 300 de tokeni ieșire fiecare; fără cache, pentru că fiecare document e diferit.

Mod Intrare (150M tokeni) Ieșire (15M tokeni) Total
Standard 1.500 $ 750 $ 2.250 $
Batch 750 $ 375 $ 1.125 $

Observația onestă care încheie exemplul: pentru clasificare pe documente scurte, un model de vârf este aproape întotdeauna alegerea greșită. Rulează întâi 200 de documente pe un model din treapta de mijloc și compară acuratețea. Dacă diferența e sub pragul tău de acceptare, ai economisit un ordin de mărime.

Cache-ul: unde se decide, de fapt, factura

Toate cele trei calcule au aceeași concluzie: poziția care mișcă factura este contextul recitit. Trei reguli practice:

Prefixul trebuie să fie stabil octet cu octet. Cache-ul funcționează pe potrivire de prefix. O dată calendaristică generată la fiecare cerere, un identificator de sesiune sau o listă de unelte serializată în ordine diferită invalidează tot ce urmează. Ține la început ce nu se schimbă și pune la coadă ce variază.

Verifică, nu presupune. Dacă tokenii serviți din cache rămân zero pe cereri repetate, ai un invalidator tăcut în prompt. Nu e o problemă de model, e o problemă de ordonare.

Nu compacta din reflex. Tentația de a rezuma agresiv istoricul ca să economisești bani are un cost ascuns: fiecare compactare pierde detalii despre ce s-a încercat și de ce a eșuat. Cu contextul recitit ieftin, compromisul se schimbă. Cum se administrează corect memoria unui agent, ce se păstrează și ce se aruncă, e subiectul cursului Context Engineering și Memorie pentru Agenți AI.

Contextul de 1,05 milioane nu e uniform

Fereastra există, dar acuratețea la regăsire nu e constantă pe toată lungimea ei: analizele publicate raportează 100% în banda 256.000–512.000 de tokeni și 96,3% în banda 512.000–1.000.000, pe teste de regăsire cu mai multe „ace în carul cu fân".

Traducerea în decizii de arhitectură: umplerea ferestrei nu înlocuiește un sistem de recuperare a informației. Peste jumătate de milion de tokeni, plătești liniar mai mult și primești o probabilitate ceva mai mică să găsești exact fragmentul care contează. Pentru baze de cunoștințe mari, un RAG bine construit rămâne mai ieftin și mai fiabil decât „bag tot în prompt".

Effort: pârghia de calitate și de cost, în același loc

reasoning.effort acceptă cinci trepte, de la low la max. Fiecare treaptă schimbă simultan trei lucruri: adâncimea raționamentului, numărul de tokeni consumați și latența.

Regula de calibrare care funcționează în practică: pornește de la treapta implicită, apoi coboară, nu urca. Rulează setul tău de evaluare la high, apoi la medium, apoi la low, și oprește-te la ultima treaptă care încă trece criteriul de acceptare. Pe sarcinile de rutină — clasificare, extragere, reformulare — treptele de jos livrează practic același rezultat la o fracțiune din cost. Treptele xhigh și max își merită prețul doar acolo unde corectitudinea contează mai mult decât factura și unde ai măsurat că treapta de dedesubt nu ajunge.

Fără un set de evaluare, calibrarea asta e ghicit. Cu unul, e o după-amiază de lucru care taie durabil din factură; construirea lui e conținutul cursului AI Evals pentru LLM-uri în Producție.

Migrarea de pe GPT-5.6 Sol: lista de verificare

  1. Recalculează bugetul, nu îl extrapola. Tariful e de 2,5 ori mai mare. Dacă modelul consumă mai puțini tokeni de ieșire pe sarcinile tale — cum susține OpenAI că se întâmplă pe unele categorii — diferența reală va fi mai mică. Măsoară pe 30 de cazuri înainte de a muta tot traficul.
  2. Verifică limita de intrare. 922.000 de tokeni, nu 1.050.000. Prompturile construite până la limita teoretică vor eșua.
  3. Recalibrează effort. Setarea moștenită de pe modelul anterior nu e neapărat optimul pe cel nou.
  4. Testează cache-ul după migrare. Structura promptului s-a putut schimba fără să observi; un prefix instabil anulează economia principală.
  5. Mută în Batch tot ce poate aștepta. E singura reducere de 50% pe care o primești fără nicio pierdere de calitate.
  6. Verifică activarea pe planurile de echipă. Pe Enterprise, modelul este dezactivat implicit la lansare — administratorul spațiului de lucru trebuie să îl activeze.
  7. Nu presupune că accesul e garantat. Astra atinge pragul „Critical" la securitate cibernetică în cadrul intern de evaluare al OpenAI, iar capabilitățile sensibile sunt condiționate de programul Daybreak. Contextul complet e în analiza lansării.

Ce nu scrie în grila de prețuri

Monitorizarea automată poate opri sarcini legitime. Odată cu Astra, OpenAI a introdus mecanisme care detectează și întrerup acțiuni potențial neconforme în sarcinile cu unelte. Compania recunoaște că această monitorizare poate opri și muncă legitimă. Pentru un flux automat care rulează noaptea, asta înseamnă că ai nevoie de reluare controlată și de alertare, nu de presupunerea că sarcina s-a terminat.

Modelul e mai greu de auditat. OpenAI afirmă că monitorizabilitatea lui Astra a scăzut față de GPT-5.6 Sol. Nu e o problemă de facturare, dar e o problemă de guvernanță: cu cât modelul e mai greu de explicat, cu atât logarea deciziilor din sistemul tău trebuie să fie mai bună.

Costurile se decontează în valută. Pentru o firmă din România, factura de API intră în regimul de servicii intracomunitare sau din afara UE, cu implicații de taxare inversă și de raportare. Tratamentul fiscal corect al abonamentelor și al consumului de API e detaliat separat în ghidul despre abonamente AI pe firmă.

Întrebări frecvente

Î: Cât costă GPT-6 Astra în API? R: La tariful standard, 10 $ per milion de tokeni la intrare, 1 $ per milion pentru intrarea servită din cache și 50 $ per milion la ieșire. În Batch și în Flex, tarifele sunt înjumătățite (5 $ / 0,50 $ / 25 $), iar în Fast Mode sunt dublate (20 $ / 2 $ / 100 $). Nu există nivel gratuit.

Î: Care este fereastra de context reală? R: 1.050.000 de tokeni fereastră totală, din care maximum 922.000 pot fi intrare și maximum 128.000 ieșire. Acuratețea la regăsire nu e uniformă: e raportată la 100% în banda 256.000–512.000 de tokeni și la 96,3% peste 512.000, deci un sistem de recuperare a informației rămâne util chiar și cu o fereastră atât de mare.

Î: Merită trecerea de pe GPT-5.6 Sol pe Astra? R: Merită dacă sarcinile tale sunt în zonele unde saltul e real — utilizarea autonomă a calculatorului, inginerie software în sesiuni lungi, securitate — și dacă o evaluare pe 30 de cazuri reale confirmă câștigul. Pentru scriere, sinteză și clasificare obișnuită, plătești de 2,5 ori mai mult pentru o diferență mică.

Î: Cum reduc factura fără să pierd calitate? R: În ordinea eficienței: stabilizează prefixul ca să se servească din cache, mută în Batch tot ce poate aștepta, coboară effort până la ultima treaptă care trece criteriul de acceptare și scoate din context ce nu contribuie la răspuns. Abia după toate acestea are sens discuția despre schimbarea modelului.

Î: De ce îmi apar zero tokeni serviți din cache? R: Aproape sigur ai un element variabil la începutul promptului — o dată calendaristică, un identificator de sesiune, o listă de unelte serializată în altă ordine. Cache-ul se potrivește pe prefix: orice modificare invalidează tot ce urmează după ea.

Î: Astra poate fi folosit pentru sarcini de securitate ofensivă? R: Nu în regim general. Modelul atinge pragul „Critical" la securitate cibernetică în Preparedness Framework, iar capabilitățile ofensive avansate sunt condiționate de programul Daybreak, destinat apărătorilor verificați. Pentru munca defensivă obișnuită — triaj de alerte, analiză de loguri, documentare de incidente — modelul este disponibil ca oricare altul, în limitele politicii de utilizare.

Concluzie

Grila de prețuri a lui GPT-6 Astra are patru linii, dar factura ta are patru pârghii: cache, mod de rulare, effort și numărul de reluări. Diferența dintre o integrare disciplinată și una făcută pe grabă este, în cifrele de mai sus, de ordinul zecilor de procente — mai mult decât diferența dintre doi furnizori.

Modelele se vor schimba din nou. Ce rămâne este metoda: un set de evaluare pe sarcini reale, un prefix stabil, un buget de context gândit înainte și disciplina de a măsura costul per sarcină finalizată, nu tariful de pe pagina de prețuri.

Surse

Articol informativ, redactat la 4 septembrie 2026 pe baza surselor citate, consultate la această dată. Calculele de cost sunt ilustrative și pornesc de la ipotezele scrise explicit în text; prețurile se modifică frecvent și trebuie verificate pe documentația oficială înainte de a fi folosite într-un buget.

Autor

Echipa editorială Cursuri AI

Redacție dedicată AI-ului aplicat, în limba română. Actualizăm articolul când se schimbă modelele, prețurile sau legislația la care face referire.

  • Surse oficiale citate în text
  • Revizuit înainte de publicare

Cursul care continuă acest articol

Integrare Avansată LLM în Aplicații de Producție

  • 26 lecții
  • ~26h de conținut
  • IT Pro

Ai citit teoria. În curs o aplici: lecții structurate pe module, exerciții și quiz-uri cu feedback imediat, Profesorul AI integrat în fiecare lecție și progres salvat automat. La final primești o atestare privată de finalizare.

Din programa cursului

  1. Fundamentele Integrării LLM în 2026
  2. Streaming și Error Handling
  3. Function Calling și Tool Use
  4. Model Context Protocol (MCP)

+ încă 5 module în programa completă

499 lei pe lună pentru acest curs, TVA 21% inclus · sau 1.999 lei pe lună pentru toate cele 25 de cursuri IT Pro.

Abonament lunar, cu reînnoire automată · anulezi oricând din contul tău · conținut digital cu acces imediat, vezi condițiile de retragere. Atestarea confirmă parcurgerea cursului și este privată — nu este diplomă și nu este calificare recunoscută de stat.

Ți-a plăcut articolul? Lasă o apreciere sau salvează-l pentru mai târziu.
Newsletter

Articole noi despre AI, o dată pe săptămână

Fără zgomot: un singur email pe săptămână, cu articolele noi și cursul asociat, când există.

Comunitate

Întrebări & sugestii

Ce au întrebat cititorii despre acest articol — și răspunsurile echipei Cursuri AI.

Mesajele sunt verificate de un moderator înainte de publicare.

Fii primul care lasă o întrebare sau o sugestie pe acest articol.

Catalogul complet

50 de cursuri AI în română, cu exerciții, quiz-uri și Profesor AI

Un curs: 499 lei pe lună · pachet Non-IT: 1.499 lei pe lună · pachet IT Pro: 1.999 lei pe lună. Toate cu TVA inclus, începutul primei lecții se citește fără cont.