Claude Haiku 5.5: ce este, preț, benchmark-uri, unde îl găsești

Claude Haiku 5.5 pe scurt: de 10 ori mai ieftin pe token sub 100.000 de tokeni, context 1M, effort reglabil. Rulează în Claude.ai, Claude Code, API și cloud.

15 minute de lectură

Claude Haiku 5.5 este modelul mic și rapid al Anthropic, lansat la 7 octombrie 2026 pentru munca de volum: clasificare, extracție, rutare, rezumate și sarcini de subagent. Față de predecesor, Claude Haiku 5.5 costă de zece ori mai puțin pe token la prompturile de cel mult 100.000 de tokeni, are context de un milion de tokeni și este primul Haiku cu effort reglabil. Mai jos: fișa tehnică, prețul, benchmark-urile citite corect, ce rupe codul existent și unde îl găsești, la 8 octombrie 2026.

Claude Haiku 5.5: prețul de listă pe cele două tarife și ce se schimbă față de Haiku 4.5

Claude Haiku 5.5, pe scurt
Ce este cea mai ieftină și mai rapidă treaptă din gama Claude; în API, claude-haiku-5-5
Lansat 7 octombrie 2026
Preț în API 0,10 $ intrarea și 0,50 $ ieșirea pe un milion de tokeni, la prompturi de cel mult 100.000 de tokeni; peste prag, 0,50 $ și 2,50 $
Unde rulează Claude.ai pe toate planurile, Claude Code, API, Amazon Bedrock, Google Cloud, Microsoft Foundry
Date în UE API-ul Anthropic: rutare globală sau doar SUA; regiuni UE pe Bedrock și Google Cloud

Ce este Claude Haiku 5.5 și ce a anunțat Anthropic

Pagina de lansare îl numește „cel mai ieftin, cel mai rapid și cel mai capabil model mic pe care l-am lansat” (traducerea noastră) și îl destină sarcinilor de volum, sensibile la cost. E prezentat și drept cel mai rapid model al companiei; o notă de subsol precizează că, în Fast Mode, modelele Opus rulează mai repede.

Tot atunci, Anthropic a înjumătățit prețul citirii din cache la Sonnet 5.5 și a anunțat un credit lunar de API pentru abonații Max și Team. Gama curentă are acum patru trepte:

Scara Anthropic după lansarea lui Haiku 5.5: patru trepte, cu prețul de listă și rolul fiecăreia

Treptele de sus sunt în lansarea Claude Sonnet 5.5, în lansarea Claude Opus 5.5 și în comparația celor trei trepte de sus. Haiku 5.5 „merge bine alături de Opus 5.5 și Sonnet 5.5, ca subagent la munca de cod”, spune anunțul; tiparul este în Haiku 5.5 vs Opus 5.5.

Un model de 0,10 $ își arată valoarea abia într-o aplicație care îl apelează de zeci de mii de ori: un clasificator de tichete, un extractor de câmpuri, un router. Acolo contează ieșirile structurate validate, tratarea erorilor cu retry și bugetul de tokeni citit din usage, adică materia cursului Construire de Aplicații AI cu Python și SDK-uri. Cursul a fost scris înainte de Haiku 5.5 și folosește Haiku 4.5 în exemple; modulele se aplică la fel, cu schimbările de mai jos.

Haiku 5.5 vs Haiku 4.5: fișa tehnică, rând cu rând

Valorile sunt din fișa modelului și din pagina „What's new in Claude Haiku 5.5”.

Specificație Haiku 5.5 Haiku 4.5
Identificator în API claude-haiku-5-5, fără sufix de dată claude-haiku-4-5
Preț pe 1M tokeni de la 0,10 $ / 0,50 $ 1 $ / 5 $
Context 1M tokeni 200K
Ieșire maximă 128K; 300K în Batch API, cu header beta 64K
Thinking adaptiv, pornit implicit extended, manual, cu budget_tokens
Effort low, medium (implicit), high, xhigh, max nu există
Tokenizer cel nou: același text, circa 30 % mai mulți tokeni cel anterior
Prag minim de cache 512 tokeni 4.096 tokeni
Unelte noi browser use; computer use prin computer_toolset_20260801 computer use prin computer_20250124
Retragere nu mai devreme de 7 octombrie 2027 „legacy”; nu mai devreme de 15 octombrie 2026

Thinking adaptiv înseamnă că modelul decide singur dacă și cât gândește; se poate opri doar la effort low, medium sau high. Browser use există doar pe Claude API și Google Cloud.

Claude Haiku 5.5: preț, cele două tarife și ce înseamnă „75 % mai ieftin”

Haiku 5.5 este singurul model curent al Anthropic taxat după lungimea promptului. Din pagina de prețuri, în dolari pe un milion de tokeni:

Tip de token Prompt de cel mult 100.000 de tokeni Prompt de peste 100.000 Haiku 4.5
Intrare 0,10 $ 0,50 $ 1 $
Ieșire 0,50 $ 2,50 $ 5 $
Scriere în cache, 5 minute 0,125 $ 0,625 $ 1,25 $
Citire din cache 0,01 $ 0,05 $ 0,10 $
Batch API, intrare / ieșire 0,05 $ / 0,25 $ 0,25 $ / 1,25 $ 0,50 $ / 2,50 $

Pragul mută toată cererea: peste 100.000 de tokeni în prompt, tariful mare se aplică și ieșirii, și cache-ului. Documentația nu spune explicit dacă tokenii citiți din cache intră în prag; calculează ca și cum ar intra.

De unde vine „75 %”. Anunțul spune că modelul costă, în medie, cu circa 75 % mai puțin de rulat decât Haiku 4.5. Nota de subsol: prețul e cu 90 % mai mic sub prag și cu 50 % mai mic peste, 90 % dintre cererile către Haiku 4.5 erau sub prag, iar calculul include tokenizerul nou. Formula nu e publicată, dar aritmetica arată de ce media nu e 90 %: cu circa 30 % mai mulți tokeni pe același text, o cerere sub prag costă 13 % din cât costa (1,3 × 0,1), iar una peste prag, 65 %.

Un exemplu, cu ipoteze declarate. Un clasificator de tichete face 100.000 de cereri pe lună; pe Haiku 4.5, fiecare avea 2.000 de tokeni de intrare și 200 de ieșire. Presupunem 30 % mai mulți tokeni pe Haiku 5.5 și nicio gândire (ipoteză, nu măsurătoare).

Tokeni pe lună Cost
Haiku 4.5 200M + 20M 200 $ + 100 $ = 300 $
Haiku 5.5 260M + 26M 26 $ + 13 $ = 39 $

Economia este de 87 %; în Batch API, factura scade la 19,50 $. Gândirea se facturează ca ieșire: dacă dublează tokenii de ieșire, totalul urcă la 52 $.

Capcana pragului. Un document de 70.000 de tokeni pe Haiku 4.5 are circa 91.000 pe Haiku 5.5 și costă 0,0098 $, cu un răspuns de 1.300 de tokeni. Unul de 90.000 ajunge la 117.000, trece pragul și costă 0,062 $: de 6,3 ori mai mult pentru 29 % mai mult text. Numărat pe vechiul tokenizer, pragul stă pe la 77.000 de tokeni.

GPT-6 Luna, de la OpenAI, are același preț de listă, cu prag propriu la 272.000 de tokeni; ce automatizezi la acest preț este în analiza GPT-6 Luna.

Context window de 1M și consumul de tokeni

Fereastra de un milion de tokeni, de cinci ori cât la Haiku 4.5, înseamnă circa 555.000 de cuvinte, potrivit documentației, dar tot ce trece de 100.000 de tokeni plătește tariful mare. Trei lucruri se numără altfel:

  • Același text, mai mulți tokeni. Valorile din usage cresc, iar un max_tokens reglat pentru Haiku 4.5 poate tăia răspunsul; ghidul de migrare cere renumărarea prompturilor pe claude-haiku-5-5.
  • Gândirea intră în max_tokens. Un plafon mic poate opri cererea înainte de orice text.
  • Textul gândirii lipsește implicit. Blocul vine gol, deci plătești mai mulți tokeni de ieșire decât vezi.

Benchmark-urile Haiku 5.5: tabelul Anthropic, citit corect

Tabelul din anunț, cu o coloană adăugată de noi din system card: cine a rulat testul.

Test Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5 (reper) Cine a rulat
GDPval-AA v2.1 (muncă profesională, Elo) 1.620 735 1.437 1.840 Artificial Analysis
AA-Briefcase v1.1 (proiecte lungi, Elo) 1.578 614 1.336 1.824 Artificial Analysis
OSWorld 2.1, subsetul offline (computer use) 72,4 % 15,7 % 48,9 % 83,9 % Anthropic, inclusiv pentru Luna
Humanity's Last Exam, fără / cu unelte 45,9 % / 57,4 % 10,2 % / 18,7 % nu apare 56,9 % / 64,5 % Anthropic
Terminal-Bench 4.0 (cod agentic în terminal) 39,2 % 0,0 % 16,4 % 70,6 % Anthropic; Luna, din clasamentul public
FrontierCode 1.1, Main (cod acceptat fără editări) 46,4 % nu apare 42,4 % 52,1 % la xhigh Cognition
Chartography, fără unelte (citirea graficelor) 46,4 % 6,4 % 29,1 % 61,6 % Anthropic; Luna, raportat de Surge AI

Cum se citește:

  1. Cifrele lui Haiku 5.5 sunt la effort max, spune system card-ul; implicit în API este medium, unde modelul are 1.277 pe GDPval-AA și 1.372 pe AA-Briefcase.
  2. Elo nu e procent. E un clasament din comparații oarbe, două câte două, relativ la modelele comparate: Sonnet 5.5 apare aici cu 1.840 și 1.824; la lansarea lui, cu 1.844 și 1.811.
  3. „Subsetul offline” înseamnă 82 din cele 108 sarcini OSWorld, fără internet. 72,4 % este scor cu credit parțial; rata strictă, cu toate punctele de control îndeplinite, este 37,1 %.
  4. 0,0 % nu e greșeală de tipar. Haiku 4.5 nu a trecut nicio rulare pe Terminal-Bench 4.0. La Haiku 5.5, 1,8 % din rulări au fost oprite de clasificatoare și numărate ca eșecuri.
  5. Rândul FrontierCode amestecă niveluri de effort. La max, Sonnet 5.5 are 46,2 %, sub cele 46,4 % ale lui Haiku 5.5.

Pe cod agentic complex, anunțul însuși spune că Sonnet 5.5 și Opus 5.5 rămân alegeri mai bune; când poți coborî de pe Sonnet este în Haiku 5.5 vs Sonnet 5.5.

O măsurătoare independentă. Artificial Analysis dă lui Haiku 5.5 la max 43 de puncte pe indicele propriu de inteligență și 243 de tokeni de ieșire pe secundă, față de o mediană de 111 în clasa lui de preț. La același nivel, timpul până la primul token este de 323 de secunde: „rapid” descrie viteza de generare, nu latența totală.

Effort reglabil: ce arată graficele pe niveluri

Este primul Haiku la care alegi între cost și calitate fără să schimbi modelul. Punctele sunt din graficele anunțului:

Effort GDPval-AA v2.1 (Elo · cost pe sarcină) OSWorld 2.1 offline (scor · cost pe încercare)
low 1.125 · 0,012 $ 42,0 % · 0,07 $
medium (implicit) 1.277 · 0,030 $ 53,3 % · 0,13 $
high 1.420 · 0,089 $ 61,3 % · 0,18 $
xhigh 1.513 · 0,27 $ 67,6 % · 0,28 $
max 1.620 · 0,87 $ 72,4 % · 0,61 $

De la medium la max, costul pe sarcină crește de circa 28 de ori pe GDPval-AA și de aproape 5 ori pe OSWorld. Singurul punct al lui Haiku 4.5 pe OSWorld, 15,7 % la 1,45 $ pe încercare, e mai scump decât Haiku 5.5 la max și sub scorul lui de la low.

Ghidul de prompting recomandă low pentru chat și cereri simple de volum, medium ca punct de pornire, iar xhigh și max doar unde evaluările tale arată un câștig. Schimbarea effort-ului între cereri invalidează cache-ul mesajelor.

Ce rupe codul scris pentru Haiku 4.5: lista scurtă

Schimbarea identificatorului nu ajunge. Din ghidul de migrare:

  1. thinking cu budget_tokens întoarce 400; treci pe {"type": "adaptive"} și reglezi din output_config.effort.
  2. temperature, top_p și top_k cu valori nestandard întorc 400; le scoți.
  3. Prefill-ul, un ultim mesaj de asistent pe care modelul îl continuă, întoarce 400; folosești structured outputs sau unelte.
  4. computer_20250124 întoarce 400 pe Claude API și Google Cloud; treci pe computer_toolset_20260801.
  5. Un bloc de thinking retrimis după ce ai modificat system, tools sau mesaje anterioare întoarce 400 (pe conturile de dinainte de 31 august 2026, doar cu un parametru anume).
  6. Fără eroare: răspunsul poate începe cu un bloc thinking, deci selectezi blocurile după type; apare stop_reason: "refusal"; Priority Tier nu e disponibil.
import anthropic

client = anthropic.Anthropic()  # citește ANTHROPIC_API_KEY din mediu

raspuns = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,                  # gândirea consumă din același plafon
    output_config={"effort": "low"},  # implicit: "medium"
    messages=[{"role": "user", "content": "Clasifică tichetul: «Factura are TVA greșit»"}],
)

if raspuns.stop_reason == "refusal":
    # HTTP 200, nu excepție; fără fallback pe server
    print("refuz:", raspuns.stop_details.category if raspuns.stop_details else None)
elif raspuns.stop_reason == "max_tokens":
    print("plafon atins: ridică max_tokens sau coboară effort")
else:
    print("".join(b.text for b in raspuns.content if b.type == "text"))

print(raspuns.usage.input_tokens, raspuns.usage.output_tokens)

SDK-ul Python anthropic din seria 1.x nici nu mai are parametrii de sampling: temperature dă TypeError. Bucla completă, cu schemă Pydantic și retry, se construiește în cursul de aplicații AI cu Python.

Unde găsești Claude Haiku 5.5: aplicații, Claude Code, API, cloud

În aplicațiile Claude. Potrivit paginii Claude Haiku de pe anthropic.com, utilizatorii planului fără abonament și ai planurilor Pro, Max, Team și Enterprise pot selecta Haiku 5.5 pe Claude.ai, pe web, iOS și Android. Limitele de mesaje nu sunt publicate acolo.

În Claude Code. De la versiunea 2.1.293, cu claude --model claude-haiku-5-5. Aliasul haiku duce la Haiku 5.5 doar pe API-ul Anthropic; pe platformele cloud duce încă la Haiku 4.5.

În API. Aceleași limite de rată ca la Haiku 4.5. România este pe lista țărilor în care Anthropic oferă API-ul și Claude.ai.

Pe platformele cloud. Amazon Bedrock (acces stabilit de AWS, de verificat în consolă), Google Cloud, Microsoft Foundry și Claude Platform on AWS.

Fără cod propriu. Cine apelează un model din n8n, Zapier sau Make tot proiectează fluxul: ce pas clasifică, ce pas validează, ce se întâmplă la refuz. Asta e materia cursului Automatizare Workflow Enterprise, care nu discută modele anume.

Ce se poate procesa în UE

Pe API-ul Anthropic, inference_geo acceptă doar global și us; o opțiune „doar UE” nu există. Google Cloud are un endpoint multi-regiune eu, iar Amazon Bedrock, endpointuri regionale, ambele cu 10 % peste cel global; dacă Haiku 5.5 e activ în regiunea ta se verifică în consola furnizorului. Pentru Microsoft Foundry, Anthropic marchează Europa cu „în curând”. Ce date ai voie să trimiți rămâne decizia firmei, sub GDPR: vezi ghidul despre datele clienților.

Siguranța pe scurt: clasificatoare și stop_reason: "refusal"

Haiku 5.5 rulează clasificatoare care pot refuza o cerere, lucru nou față de Haiku 4.5. Refuzul vine ca răspuns HTTP 200, cu stop_reason: "refusal" și o categorie în stop_details.category: cyber, bio, frontier_llm sau general_harms. În practică:

  • nu există fallback pe server, iar retrimiterea aceleiași cereri aduce de obicei alt refuz;
  • monitorizarea pe rata de erori nu vede refuzurile;
  • refuzurile din categoriile bio și frontier_llm se facturează, chiar dacă vin înainte de orice text.

Potrivit anunțului, protecțiile cyber sunt mai restrictive decât la Haiku 4.5 și blochează testele de penetrare. System card-ul notează și un minus: în auditul comportamental automat, modelul a refuzat în exces mai des decât oricare alt model testat.

Cache la jumătate pe Sonnet 5.5 și credit lunar de API pentru Max și Team

Sonnet 5.5. Citirea din cache costă acum 0,10 $ pe un milion de tokeni în loc de 0,20 $, adică 5 % din prețul de intrare; restul tarifelor nu se schimbă. Anthropic estimează o scădere de circa 20 % a costului pe majoritatea sarcinilor agentice.

Creditul lunar. Max 5x primește 100 $ pe lună, Max 20x, 200 $, iar Team, 20 $ pe loc Standard și 100 $ pe loc Premium, cumulate și plafonate la 500 $. Acoperă Claude API, Managed Agents și Agent SDK, nu și Claude Code interactiv sau platformele cloud; nu se reportează și nu se acordă pe planul fără abonament, pe Pro sau pe Enterprise.

Pentru cine merită Haiku 5.5 și pentru cine nu

Merită testat acum dacă:

  • rulezi Haiku 4.5: documentația recomandă migrarea, iar sub prag același text costă cu circa 87 % mai puțin;
  • ai clasificare, extracție sau rutare la volum, cu prompturi sub prag;
  • construiești agenți și ai nevoie de o treaptă ieftină pentru subagenți;
  • vrei computer use pe sarcini repetitive: pe OSWorld, saltul e de la 15,7 % la 72,4 %.

Nu merită încă dacă:

  • sarcina e cod agentic complex: 39,2 % pe Terminal-Bench 4.0, față de 70,6 % la Sonnet 5.5;
  • prompturile tale trec constant de 100.000 de tokeni;
  • depinzi de temperature, de prefill sau de Priority Tier;
  • ai nevoie de inferență doar în UE pe API-ul Anthropic.

Ce verifici în prima săptămână

  1. Numeri din nou prompturile cu count_tokens și afli câte trec de 100.000 de tokeni.
  2. Rulezi setul tău de cazuri la low, medium și high și te oprești la primul nivel care trece pragul.
  3. Verifici max_tokens și răspunsurile goale.
  4. Numeri refuzurile pe categorii.
  5. Măsori latența cap-coadă la effort-ul ales.
  6. Calculezi costul pe sarcină reușită din usage.

Setul de cazuri și notarea automată sunt în cum evaluezi un model AI înainte de producție; alegerea treptei pe cost pe sarcină este materia cursului Comparație Modele AI, scris înainte de această lansare.

Întrebări frecvente

Ce este Claude Haiku 5.5? Modelul mic și rapid al Anthropic, lansat la 7 octombrie 2026, cu identificatorul claude-haiku-5-5. Documentația îl destină sarcinilor de volum, sensibile la latență: clasificare, extracție, rutare.

Cât costă Claude Haiku 5.5? În API, 0,10 $ pe un milion de tokeni de intrare și 0,50 $ pe un milion de ieșire, pentru prompturi de cel mult 100.000 de tokeni; peste prag, 0,50 $ și 2,50 $. Batch API înjumătățește tarifele.

Este Haiku 5.5 inclus în planul Claude fără abonament? Da, potrivit paginii Claude Haiku de pe anthropic.com: utilizatorii planului fără plată îl pot selecta pe Claude.ai. Creditul lunar de API se acordă doar pe Max și Team.

Există Claude Haiku 5.0? Nu. La 8 octombrie 2026, documentația listează Haiku 5.5, Haiku 4.5 ca „legacy” și modelele retrase Haiku 3.5 și Haiku 3. Versiunea 5 există la Sonnet, Opus și Fable, nu și la Haiku.

Ce se întâmplă cu Claude Haiku 4.5? Rămâne disponibil. Pagina de retrageri îl arată activ, cu mențiunea „nu mai devreme de 15 octombrie 2026”, iar Anthropic promite cel puțin 60 de zile de preaviz.

Ce context window are Haiku 5.5 și cum se numără tokenii? Un milion de tokeni, cu tarif mai mare pentru prompturile de peste 100.000. Tokenizerul nou numără cu circa 30 % mai mulți tokeni pe același text, iar gândirea se facturează ca ieșire.

Concluzie

Claude Haiku 5.5 mută treapta de jos a gamei Anthropic: de zece ori mai ieftin pe token sub prag, cu context de 1M și effort reglabil. Cifra de reținut nu e „75 %”, ci pragul de 100.000 de tokeni: sub el, același text costă cu circa 87 % mai puțin decât pe Haiku 4.5; peste el, cu 35 %.

Limitele sunt la vedere: cifrele din tabel sunt la effort max, codul vechi se rupe în cinci puncte, refuzurile vin ca răspunsuri reușite, iar pentru cod agentic complex anunțul însuși trimite la Sonnet 5.5 și Opus 5.5. Restul se vede pe sarcinile tale, cu tokenii numărați din nou.

Surse

Citite la 8 octombrie 2026:

Articol informativ, publicat la 8 octombrie 2026. Au mai fost consultate paginile Anthropic despre retrageri, refuzuri, rezidența datelor, Claude Code și creditele de API. Exemplele de cost sunt calcule pe ipotezele declarate, la prețuri de listă, fără taxe.

Autor

Echipa editorială Cursuri AI

Redacție dedicată AI-ului aplicat, în limba română. Actualizăm articolul când se schimbă modelele, prețurile sau legislația la care face referire.

  • Surse oficiale citate în text
  • Revizuit înainte de publicare

Cursul care continuă acest articol

Construire de Aplicații AI cu Python și SDK-uri (OpenAI, Anthropic): de la API la Produs

  • 27 lecții
  • ~24h de conținut
  • IT Pro

Ai citit teoria. În curs o aplici: lecții structurate pe module, exerciții și quiz-uri cu feedback imediat, Profesorul AI integrat în fiecare lecție și progres salvat automat. La final primești o atestare privată de finalizare.

Din programa cursului

  1. Fundamente: de la API de LLM la mediul tău Python
  2. Primul apel: chat completions, mesaje și parametri
  3. Streaming și UX: răspunsuri în timp real
  4. Function calling / tool use: conectează modelul la codul tău

+ încă 7 module în programa completă

499 lei pe lună pentru acest curs, TVA 21% inclus · sau 1.999 lei pe lună pentru toate cele 25 de cursuri IT Pro (vezi ce înveți în tot parcursul).

Abonament lunar, cu reînnoire automată · anulezi oricând din contul tău · conținut digital cu acces imediat, vezi condițiile de retragere. Atestarea confirmă parcurgerea cursului și este privată — nu este diplomă și nu este calificare recunoscută de stat.

Ți-a plăcut articolul? Lasă o apreciere sau salvează-l pentru mai târziu.
Newsletter

Cele mai recente articole despre AI, pe email

Primești pe loc cele mai recente trei articole și cursul asociat, când există, apoi cel mult trei emailuri în următoarele două săptămâni. Te dezabonezi oricând.

Comunitate

Întrebări & sugestii

Ce au întrebat cititorii despre acest articol — și răspunsurile echipei Cursuri AI.

Mesajele sunt verificate de un moderator înainte de publicare.

Fii primul care lasă o întrebare sau o sugestie pe acest articol.

Catalogul complet

50 de cursuri AI în română, cu exerciții, quiz-uri și Profesor AI

Un curs: 499 lei pe lună · pachet Non-IT: 1.499 lei pe lună · pachet IT Pro: 1.999 lei pe lună. Toate cu TVA inclus, începutul primei lecții se citește fără cont.