I modelli di linguaggio producono output variabili e la loro qualità dipende dal contesto, dal prompt, dagli strumenti e dai dati. Un test manuale su dieci esempi piacevoli non permette di scegliere un'architettura né di garantire un aggiornamento. È necessaria una disciplina di valutazione paragonabile ai test software, adattata alle risposte probabilistiche.
L'obiettivo non è ridurre ogni qualità a un voto. È rendere visibili gli errori, confrontare le versioni sugli stessi casi e definire cosa blocca una messa in produzione.
Distinguere benchmark e valutazione del prodotto
Un benchmark pubblico misura le capacità generali su un corpus dato. Aiuta a comprendere un modello, ma non rappresenta necessariamente il vocabolario, i formati, le lingue e i rischi dell’azienda.
Una valutazione del prodotto utilizza:
- compiti reali;
- dati rappresentativi ;
- vincoli di formato;
- strumenti e RAG ;
- politica di rifiuto;
- soglie di mestiere ;
- costo e latenza.
Il miglior modello pubblico può essere meno adatto di un modello più piccolo in un compito limitato.
Smontare il sistema
Una risposta finale dipende da diversi componenti: classificazione dell’intenzione, recupero, prompt, modello, strumenti e post-elaborazione. Valutarli separatamente aiuta a individuare una regressione.
Per un RAG, misurare il recupero e la generazione. Per un agente, misurare la selezione dello strumento, i parametri, il rispetto delle autorizzazioni e il risultato. Per un'estrazione, distinguere il riconoscimento del documento e il valore dei campi.
Costruire un insieme di casi rappresentativi
Il gioco deve coprire:
- casi frequenti;
- casi ad alto valore;
- formulazioni varie ;
- lingue ;
- dati incompleti;
- ambiguità ;
- rifiuti attesi;
- attacchi;
- casi storicamente difettosi.
Ogni caso possiede un identificativo, un'intenzione, degli input, un risultato atteso o una sezione, un livello di rischio e dei tag. Gli esempi di produzione sono anonimizzati e selezionati secondo una politica.
Piramide che combina controlli deterministici, valutazioni dei componenti, scenari completi, revisione umana e monitoraggio in produzione.
Definire le dimensioni della qualità
Secondo il compito, valutare:
- esattezza dei fatti o dei valori ;
- completezza degli elementi necessari ;
- fedeltà alle fonti ;
- formato e struttura ;
- pertinenza ;
- utilità per l’azione ;
- stile e tono ;
- sicurezza ;
- qualità del rifiuto ;
- esplicabilità o citazioni.
Ogni dimensione riceve una definizione ed esempi di voti. Un criterio vago produce giudici incoerenti.
I controlli deterministici prima
Prima di un giudizio semantico, verificare ciò che può esserlo tramite codice: JSON valido, campi presenti, valori autorizzati, riferimenti esistenti, calcoli, lunghezza, lingua, citazioni e chiamata di strumenti.
Questi test sono rapidi, riproducibili e facili da integrare in CI. Eliminano errori senza chiedere a un modello di giudicare un formato.
Costruire una verità sul campo
Per un'estrazione o classificazione, degli esperti possono annotare il risultato corretto. Per una generazione, è spesso preferibile definire elementi obbligatori, vietati e una sezione piuttosto che una frase unica.
I disaccordi tra esperti sono misurati. Se non sono d'accordo, chiedere al modello una risposta unica può essere irrealistico.
La verità sul campo è versionata e rivista quando il mestiere cambia.
Usare giudici umani
Gli esseri umani rimangono necessari per l’utilità, le sfumature e i rischi. La valutazione può essere cieca, con ordine casuale, al fine di limitare il bias di marca o di posizione.
I valutatori ricevono istruzioni, esempi e un meccanismo di disaccordo. Un sottoinsieme viene valutato due volte per misurare la coerenza.
Usare un modello come giudice con prudenza
Un giudice LLM permette di valutare più casi, ma ha i suoi bias. Può preferire risposte lunghe, il proprio stile o la prima opzione. Può essere influenzato dal contenuto da giudicare.
Le recinzioni di sicurezza includono:
- criteri precisi;
- uscita strutturata;
- anonimizzazione dei modelli;
- ordine casuale;
- confronto con valutazioni umane;
- diverse ripetizioni;
- sorveglianza dei disaccordi.
Il giudice accelera il triage; non trasforma un'opinione in verità assoluta.
Confrontare due versioni
Il confronto accoppiato esegue A e B sugli stessi casi. Il rapporto mostra guadagni, perdite e casi critici, non solo una media complessiva.
I risultati sono segmentati per intento, lingua e rischio. Un miglioramento sui riassunti può nascondere una regressione sui rifiuti. La dimensione del campione e l'incertezza sono visibili.
Misurare la variabilità
Un stesso input può produrre più output. Per compiti sensibili, eseguire più ripetizioni e misurare la stabilità del formato, della scelta dello strumento o della risposta.
La temperatura, il seed quando disponibile, la versione del modello e i parametri sono registrati. Un sistema può essere mediamente corretto ma troppo instabile per la produzione.
Latenza e disponibilità
Misurare il tempo totale e il tempo di ogni fase: recupero, modello, strumenti, post-elaborazione. Seguire la mediana e i percentili, non solo la media.
Gli errori, i timeout, le quote e i tentativi fanno parte della valutazione. Un modello leggermente migliore ma spesso non disponibile può essere meno utile.
Costo per attività riuscita
Il costo include token, embedding, reranking, strumenti, archiviazione e validazione umana. Deve essere riferito al caso riuscito, non solo alla richiesta.
Un'uscita incorretta può scatenare una ripresa costosa. Gli scenari di volume e di picco aiutano a confrontare instradamento e cache.
Valutare la sicurezza
Il gioco include prompt injection, esfiltrazione, dati vietati, elusione delle politiche, strumenti non autorizzati e contenuti tossici secondo l'uso. I test vengono eseguiti in un ambiente sicuro.
Un errore di sicurezza critico blocca l'avvio indipendentemente dal punteggio medio.
Definire le soglie
Ogni dimensione possiede:
- obiettivo;
- minimo accettabile ;
- soglia critica;
- proprietario dell’eccezione.
Le soglie derivano dal rischio aziendale. Un'estrazione finanziaria può richiedere un'elevata precisione e controllo; una bozza creativa accetta variazioni maggiori.
Integrare le valutazioni alla consegna
Un piccolo gioco rapido viene eseguito a ogni modifica. Una sequenza completa gira prima della versione o periodicamente. I costi sono controllati mediante campionamento e cache dei componenti non modificati.
Il rapporto confronta con una baseline e blocca le regressioni critiche. Le modifiche a prompt, modello, RAG, strumento o politica sono tutte versionate.
Sorvegliare in produzione
Le valutazioni offline non coprono tutte le richieste. La produzione segue errori, rifiuti, feedback, escalation, latenza e costo. Alcuni campioni vengono revisionati secondo una politica di riservatezza.
Gli incidenti reali diventano casi di regressione. I dati di monitoraggio non devono raccogliere più informazioni del necessario.
Evitare la contaminazione del gioco
Se il gioco viene utilizzato per regolare costantemente il prompt, diventa un gioco di allenamento implicito. Conservare un insieme nascosto e rinnovare i casi protegge la capacità di generalizzazione.
I fornitori e i modelli possono anche aver visto alcuni benchmark pubblici, ulteriore motivo per privilegiare casi propri.
Una valutazione come attività prodotta
Il gioco dei casi, le rubriche, le soglie e i rapporti diventano una proprietà strategica. Permettono di cambiare modello, di ottimizzare i costi e di dimostrare che una versione è migliore.
Partitech può costruire i giochi di valutazione, automatizzare i controlli, confrontare i modelli e integrare le regressioni nella catena di consegna. L'obiettivo è gestire la qualità basandosi su prove, non sull'impressione di una dimostrazione.
Parliamo del tuo progetto
Mettere in piedi una piattaforma di valutazione IA con Partitech. Contatta Partitech.