AI evals: cum evaluezi un model AI (LLM) în producție
Un LLM care „merge bine în demo" cade tăcut în producție: regresii la fiecare schimbare de prompt, halucinații intermitente, drift. Iată cum construiești un harness de evals care prinde problemele înainte să le vadă utilizatorii.