Echipele care sar peste evaluare descoperă regresiile de la utilizatori. Echipele care investesc din timp le descoperă în CI.
Ai nevoie de trei straturi: seturi de referință offline pentru sarcini cunoscute, porți de lansare pentru schimbări de prompt/index/model și eșantionare de producție pentru derivă live.
Notează ce contează pentru business: fundamentare, finalizarea sarcinii, corectitudinea refuzului, latență și rata de escaladare — nu doar nostalgia BLEU.
Seturile de referință sunt active de produs
Deține un set curatoriat de intrări cu comportamente așteptate, inclusiv cazuri adversariale și de retrieval gol.
Versionează setul alături de cod. Când politica de produs se schimbă, actualizează deliberat output-urile așteptate.
Blochează fiecare promovare
O schimbare de model, prompt sau index care nu trece suita nu ajunge în producție — chiar dacă un blog de furnizor spune că e mai bună.
Ține un mod shadow pentru fluxuri cu risc ridicat: stiva nouă evaluează în paralel, înainte să răspundă utilizatorilor.
Închide bucla cu trasee
Eșantionează traseele de producție în cozi de revizuire. Transformă defecțiunile recurente în cazuri de referință noi.
Datoria de evaluare se acumulează mai rapid decât datoria de cod, pentru că modelele se schimbă sub tine.
Takeaways
- Fără suită, fără AI în producție.
- Evaluează comportamentul și operarea, nu doar fluența.
- Transformă defecțiunile live în teste offline.