De Ce Evals: Problema Vibe-Checks-urilor și Costul Calității Negarantate
Din cursul AI Evals pentru LLM-uri în Producție: Testare, Scoring și Calitate pre-Deployment
Profesor AI integrat Exclusiv
Întreabă orice despre lecție și primești răspuns instant. Profesorul AI cunoaște conținutul cursului și te ajută să înveți mai eficient.
Oricine poate lipi un prompt într-un API și obține un răspuns care „pare bun”. Foarte puțini pot demonstra, cu numere, că acel sistem rămâne bun după ce schimbi modelul, ajustezi promptul sau crește traficul. Între cele două lumi stă o întrebare aparent banală, dar surprinzător de greu de răspuns riguros când sistemul e deja în producție: funcționează? — și, mai ales, cum o dovedești în fața unei echipe, a unui client sau a unui auditor care nu se mulțumește cu „mi s-a părut ok”. Disciplina care transformă acea impresie într-un răspuns măsurabil, reproductibil și apărabil se numește evaluare — pe scurt, evals — și este exact terenul pe care intri acum.
În 2026, capacitatea de a proiecta și opera evals a devenit unul dintre cele mai căutate skill-uri pentru AI engineers și product manageri tehnici. Motivul este direct: oricine poate lipi un prompt într-un API și obține un răspuns care „pare bun". Foarte puțini pot demonstra, cu numere, că acel sistem rămâne bun după ce schimbi modelul, ajustezi promptul sau crește traficul. Diferența dintre cele două lumi este exact ceea ce vei învăța aici.
Ce Este, de Fapt, un Eval
Un eval este un experiment structurat care măsoară calitatea unui sistem LLM. La nivelul cel mai abstract, are trei componente care se compun într-un lanț:
input → output → scor măsurabil
- Input — datele care intră în sistem: o întrebare a utilizatorului, un document de rezumat, o cerere de extragere de date.
- Output — ce produce sistemul tău (modelul plus promptul, plus eventual unelte și context).
- Scor măsurabil — o valoare numerică sau categorială care exprimă cât de bun este acel output, calculată de un scorer (numit și grader).
Crucial: un eval nu este o singură rulare. Este o procedură care rulează același sistem peste un set de exemple și agregă scorurile într-o metrică pe care o poți urmări în timp. Postul oficial Anthropic „Demystifying evals for AI agents" formulează ideea esențială: evals transformă întrebarea subiectivă „pare bine?" într-o întrebare obiectivă „cât de des trece testul, conform unui criteriu pe care l-am scris dinainte?".
Vocabularul de Bază
Înainte de orice, fixăm un vocabular comun pe care îl vom folosi în tot cursul. Notebook-ul building_evals din anthropic-cookbook și documentația OpenAI evals folosesc, cu mici variații, exact aceste concepte:
| Termen | Definiție | Exemplu concret |
|---|---|---|
| Dataset | Colecția de exemple pe care rulezi evalul | 200 de întrebări de suport cu răspunsul așteptat |
| Task | Ce trebuie să facă sistemul cu un input | „Clasifică tichetul în una din 5 categorii" |
| Scorer / Grader | Funcția care atribuie un scor unui output | „Output-ul == eticheta corectă?" |
| Harness | Codul care orchestrează: ia exemplele, cheamă modelul, aplică scorer-ul, agregă | Scriptul tău de eval sau framework-ul |
| Pass rate | Procentul de exemple care trec criteriul | „178 din 200 → 89% pass rate" |
Vom adăuga termeni noi pe parcurs, dar acești cinci sunt scheletul mental. Dacă îi internalizezi, restul cursului devine asamblare de piese cunoscute.
Problema Vibe-Checks-urilor
Modul implicit prin care majoritatea echipelor „testează" un sistem LLM la început se numește, semi-ironic, vibe-check: deschizi interfața, scrii câteva prompturi, citești răspunsurile, dai din cap aprobator și treci la deploy. Este tentant pentru că este rapid și pentru că, la scară mică, funcționează — îți dă un semnal real în primele minute.
Problema nu e că vibe-check-ul e inutil. Problema e că nu scalează și nu e reproductibil. Iată exact unde se rupe:
1. Nu Acoperă Spațiul de Input
Când testezi manual, încerci 5–10 cazuri pe care ți le imaginezi tu. Utilizatorii reali generează mii de variații pe care nu le anticipezi: greșeli de scriere, întrebări ambigue, limbi amestecate, prompturi adversariale, cazuri-limită. Un vibe-check pe „happy path" nu spune nimic despre coadă-lungă (long tail), care este exact locul unde sistemele LLM eșuează spectaculos.
Ai citit începutul. Restul lecției începe aici.
Deblochezi restul acestei lecții și toate celelalte 31 din curs. Alege varianta potrivită pentru tine:
Abonament lunar, cu reînnoire automată · anulezi oricând din contul tău · conținut digital cu acces imediat, vezi condițiile de retragere.
Ce urmează în această lecție
- 2. Nu Este Reproductibil
- 3. Judecata Umană Driftează
- Costul Calității Negarantate în Producție
- Regresii Tăcute (Silent Regressions)
- Comportament Non-Determinist
- Iluzia determinismului: aceeași întrebare, două răspunsuri
- Rularea 1 → "Capitala Australiei este Canberra." ✅
- Rularea 2 → "Capitala Australiei este Sydney, cel mai..." ❌
Tot ce înveți în acest curs
1 Fundamentele Evaluării LLM: De la Vibe-Checks la Măsurare Riguroasă 3 lecții
- De Ce Evals: Problema Vibe-Checks-urilor și Costul Calității Negarantate O citești acum 52 min
- Taxonomia Evaluării: Offline vs Online, Determinist vs LLM-Judge 54 min
- Metrici Statistice și de Acord: Pass Rate, Praguri, Intervale de Încredere 50 min
2 Golden Datasets: Curare, Etichetare și Date Sintetice Fără PII 4 lecții
- Anatomia unui Golden Dataset: Structură, Acoperire și Versionare 52 min
- Curare și Etichetare: De la Logs de Producție la Adevăr de Referință 54 min
- Date Sintetice Fără PII: Generare, Anonimizare și Conformitate GDPR 56 min
- Edge-Cases, Adversarial Inputs și Mentenanța în Timp a Datasetului 50 min
3 LLM-as-a-Judge: Rubrici, Calibrare și Mitigarea Bias-urilor 4 lecții
- LLM-as-a-Judge: Când Folosești un Model ca Evaluator și Când Nu 52 min
- Design de Rubrici: Criterii Clare, Scale și Chain-of-Thought pentru Judecător 56 min
- Bias-urile Judecătorului: Position, Verbosity, Self-Preference și Mitigarea Lor 54 min
- Calibrarea Judecătorului față de Oameni: Agreement, Kappa și Meta-Evaluare 52 min
4 Metrici pentru RAG și Generare: Faithfulness, Relevancy și Context (RAGAS) 4 lecții
- De Ce RAG Are Nevoie de Metrici Proprii: Retriever vs Generator 50 min
- Faithfulness și Answer Relevancy: Măsori Halucinația și Utilitatea Răspunsului 54 min
- Context Precision și Context Recall: Calitatea Retrieverului 52 min
- Metrici pentru Generare Non-RAG: Sumarizare, Tone, Format și Task Success 50 min
5 DeepEval în Practică: Metrici, Test Suites și Metric Gates 3 lecții
- DeepEval: Modelul Mental, Instalare și Primul Test Case 52 min
- Metrici și Test Suites în DeepEval: G-Eval, RAG Metrics și Custom Metrics 56 min
- Metric Gates ca Poartă de Calitate: Praguri, Pass/Fail și Raportare 52 min
6 Promptfoo: Comparare, Red-Teaming și Quality Gate în CI 3 lecții
- Promptfoo: Config Declarativ, Comparare de Prompturi și Modele 52 min
- Red-Teaming cu Promptfoo: Probe de Robustețe pentru Calitate 54 min
- Promptfoo în CI ca Quality Gate: Integrare și Decizii de Deploy 50 min
7 Regression Suites și CI/CD: Previi Degradarea Calității la Fiecare Deploy 3 lecții
- Regression Testing pentru LLM: De Ce Calitatea Se Degradează Tăcut 52 min
- Pipeline CI/CD de Evals: Gates, Sharding, Flakiness și Raportare 56 min
- Eval-Gating la Schimbarea Modelului: Migrare și A/B între Versiuni 52 min
8 Cost și Operaționalizare: Bugetare, Sampling și Monitorizare în Producție 2 lecții
- Bugetarea Modelului-Judecător: Cost, Sampling și Tiering de Modele 52 min
- Monitorizare în Producție: Online Evals, Sampling de Trafic și Alerting 54 min
9 Evals și Conformitate EU AI Act: Context, Nu Sfat Juridic 2 lecții
- Evals ca Probă: Testing Data și Conformity Assessment (Art. 43) 52 min
- Documentarea Calității: Model Cards, Eval Reports și Pista de Audit 50 min
10 Proiect Capstone: Suită de Evals End-to-End Integrată în CI 3 lecții
- Proiectarea Suitei Capstone: Aplicația, Golden Dataset și Planul de Evaluare 54 min
- Implementarea Evals: DeepEval + Promptfoo, Calibrarea Judecătorului și Raportare 56 min
- Integrarea în CI și Evaluarea Finală a Cursului 54 min
11 Apendice: Resurse Oficiale, Actualizări 2026 și Trasee de Învățare 1 lecții
- Resurse Oficiale, Actualizări 2026 și Trasee de Învățare 34 min
Tot ce ai nevoie ca să înveți eficient
Quiz-uri interactive
Verifică-ți cunoștințele la finalul fiecărei lecții cu quiz-uri cu scor și feedback.
Notițe personale
Salvează notițe pe fiecare lecție, accesibile oricând din dashboard.
Recapitulări programate
Revii la lecții exact când e nevoie, la intervalele potrivite — reții pe termen lung.
Progres & Realizări
Urmărește progresul, deblochează achievement-uri și vizualizează ce ai învățat.
Bookmark-uri
Salvează lecțiile importante și găsește-le instant când ai nevoie.
Întrebări & Răspunsuri
Pune întrebări direct pe lecție și primește răspunsuri de la echipa noastră.
Bun de știut înainte să începi
Cum primesc acces la curs?
Începutul primei lecții îl citești gratuit, chiar pe această pagină. Pentru curs îți creezi cont, alegi abonamentul potrivit — curs individual sau pachet — și primești acces imediat după confirmarea plății. Totul se întâmplă 100% online.
Pot anula abonamentul oricând?
Da. Anulezi oricând, direct din contul tău, în câteva click-uri. Accesul rămâne activ până la finalul perioadei deja plătite.
Ce include abonamentul pentru acest curs?
Toate cele 32 lecții din curs, quiz-uri interactive, profesorul AI integrat în fiecare lecție (selectezi orice pasaj și ți-l explică pe loc), notițe personale, progres salvat automat și actualizări de conținut incluse.
Există un program fix de învățare?
Nu. Înveți în ritmul tău, de pe orice dispozitiv. Lecțiile sunt structurate pas cu pas, iar platforma îți salvează automat progresul, ca să poți continua oricând de unde ai rămas.
Pregătit să deblochezi tot conținutul?
Doar acest curs — 499 lei / lună, cu TVA — sau toate cele 25 cursuri IT Pro, cu trasee și Profesorul AI inclus, în pachetul de 1.999 lei / lună, cu TVA. Atestarea de finalizare rămâne a ta și după ce anulezi.
