Parliamo del progetto
Valutazione IA

Valutare un LLM o un assistente IA: qualità, latenza, costo e regressioni

Un benchmark pubblico classifica i modelli su compiti generali. Una valutazione del prodotto misura la vostra qualità, con i vostri dati, i vostri vincoli e i vostri errori costosi.

Valutare un LLM o un assistente IA: qualità, latenza, costo e regressioni

I modelli di linguaggio producono output variabili e la loro qualità dipende dal contesto, dal prompt, dagli strumenti e dai dati. Un test manuale su dieci esempi piacevoli non permette di scegliere un'architettura né di garantire un aggiornamento. È necessaria una disciplina di valutazione paragonabile ai test software, adattata alle risposte probabilistiche.

L'obiettivo non è ridurre ogni qualità a un voto. È rendere visibili gli errori, confrontare le versioni sugli stessi casi e definire cosa blocca una messa in produzione.

Distinguere benchmark e valutazione del prodotto

Un benchmark pubblico misura le capacità generali su un corpus dato. Aiuta a comprendere un modello, ma non rappresenta necessariamente il vocabolario, i formati, le lingue e i rischi dell’azienda.

Una valutazione del prodotto utilizza:

  • compiti reali;
  • dati rappresentativi ;
  • vincoli di formato;
  • strumenti e RAG ;
  • politica di rifiuto;
  • soglie di mestiere ;
  • costo e latenza.

Il miglior modello pubblico può essere meno adatto di un modello più piccolo in un compito limitato.

Smontare il sistema

Una risposta finale dipende da diversi componenti: classificazione dell’intenzione, recupero, prompt, modello, strumenti e post-elaborazione. Valutarli separatamente aiuta a individuare una regressione.

Per un RAG, misurare il recupero e la generazione. Per un agente, misurare la selezione dello strumento, i parametri, il rispetto delle autorizzazioni e il risultato. Per un'estrazione, distinguere il riconoscimento del documento e il valore dei campi.

Costruire un insieme di casi rappresentativi

Il gioco deve coprire:

  • casi frequenti;
  • casi ad alto valore;
  • formulazioni varie ;
  • lingue ;
  • dati incompleti;
  • ambiguità ;
  • rifiuti attesi;
  • attacchi;
  • casi storicamente difettosi.

Ogni caso possiede un identificativo, un'intenzione, degli input, un risultato atteso o una sezione, un livello di rischio e dei tag. Gli esempi di produzione sono anonimizzati e selezionati secondo una politica.

Piramide che combina controlli deterministici, valutazioni dei componenti, scenari completi, revisione umana e monitoraggio in produzione.

Definire le dimensioni della qualità

Secondo il compito, valutare:

  • esattezza dei fatti o dei valori ;
  • completezza degli elementi necessari ;
  • fedeltà alle fonti ;
  • formato e struttura ;
  • pertinenza ;
  • utilità per l’azione ;
  • stile e tono ;
  • sicurezza ;
  • qualità del rifiuto ;
  • esplicabilità o citazioni.

Ogni dimensione riceve una definizione ed esempi di voti. Un criterio vago produce giudici incoerenti.

I controlli deterministici prima

Prima di un giudizio semantico, verificare ciò che può esserlo tramite codice: JSON valido, campi presenti, valori autorizzati, riferimenti esistenti, calcoli, lunghezza, lingua, citazioni e chiamata di strumenti.

Questi test sono rapidi, riproducibili e facili da integrare in CI. Eliminano errori senza chiedere a un modello di giudicare un formato.

Costruire una verità sul campo

Per un'estrazione o classificazione, degli esperti possono annotare il risultato corretto. Per una generazione, è spesso preferibile definire elementi obbligatori, vietati e una sezione piuttosto che una frase unica.

I disaccordi tra esperti sono misurati. Se non sono d'accordo, chiedere al modello una risposta unica può essere irrealistico.

La verità sul campo è versionata e rivista quando il mestiere cambia.

Usare giudici umani

Gli esseri umani rimangono necessari per l’utilità, le sfumature e i rischi. La valutazione può essere cieca, con ordine casuale, al fine di limitare il bias di marca o di posizione.

I valutatori ricevono istruzioni, esempi e un meccanismo di disaccordo. Un sottoinsieme viene valutato due volte per misurare la coerenza.

Usare un modello come giudice con prudenza

Un giudice LLM permette di valutare più casi, ma ha i suoi bias. Può preferire risposte lunghe, il proprio stile o la prima opzione. Può essere influenzato dal contenuto da giudicare.

Le recinzioni di sicurezza includono:

  • criteri precisi;
  • uscita strutturata;
  • anonimizzazione dei modelli;
  • ordine casuale;
  • confronto con valutazioni umane;
  • diverse ripetizioni;
  • sorveglianza dei disaccordi.

Il giudice accelera il triage; non trasforma un'opinione in verità assoluta.

Confrontare due versioni

Il confronto accoppiato esegue A e B sugli stessi casi. Il rapporto mostra guadagni, perdite e casi critici, non solo una media complessiva.

I risultati sono segmentati per intento, lingua e rischio. Un miglioramento sui riassunti può nascondere una regressione sui rifiuti. La dimensione del campione e l'incertezza sono visibili.

Misurare la variabilità

Un stesso input può produrre più output. Per compiti sensibili, eseguire più ripetizioni e misurare la stabilità del formato, della scelta dello strumento o della risposta.

La temperatura, il seed quando disponibile, la versione del modello e i parametri sono registrati. Un sistema può essere mediamente corretto ma troppo instabile per la produzione.

Latenza e disponibilità

Misurare il tempo totale e il tempo di ogni fase: recupero, modello, strumenti, post-elaborazione. Seguire la mediana e i percentili, non solo la media.

Gli errori, i timeout, le quote e i tentativi fanno parte della valutazione. Un modello leggermente migliore ma spesso non disponibile può essere meno utile.

Costo per attività riuscita

Il costo include token, embedding, reranking, strumenti, archiviazione e validazione umana. Deve essere riferito al caso riuscito, non solo alla richiesta.

Un'uscita incorretta può scatenare una ripresa costosa. Gli scenari di volume e di picco aiutano a confrontare instradamento e cache.

Valutare la sicurezza

Il gioco include prompt injection, esfiltrazione, dati vietati, elusione delle politiche, strumenti non autorizzati e contenuti tossici secondo l'uso. I test vengono eseguiti in un ambiente sicuro.

Un errore di sicurezza critico blocca l'avvio indipendentemente dal punteggio medio.

Definire le soglie

Ogni dimensione possiede:

  • obiettivo;
  • minimo accettabile ;
  • soglia critica;
  • proprietario dell’eccezione.

Le soglie derivano dal rischio aziendale. Un'estrazione finanziaria può richiedere un'elevata precisione e controllo; una bozza creativa accetta variazioni maggiori.

Integrare le valutazioni alla consegna

Un piccolo gioco rapido viene eseguito a ogni modifica. Una sequenza completa gira prima della versione o periodicamente. I costi sono controllati mediante campionamento e cache dei componenti non modificati.

Il rapporto confronta con una baseline e blocca le regressioni critiche. Le modifiche a prompt, modello, RAG, strumento o politica sono tutte versionate.

Sorvegliare in produzione

Le valutazioni offline non coprono tutte le richieste. La produzione segue errori, rifiuti, feedback, escalation, latenza e costo. Alcuni campioni vengono revisionati secondo una politica di riservatezza.

Gli incidenti reali diventano casi di regressione. I dati di monitoraggio non devono raccogliere più informazioni del necessario.

Evitare la contaminazione del gioco

Se il gioco viene utilizzato per regolare costantemente il prompt, diventa un gioco di allenamento implicito. Conservare un insieme nascosto e rinnovare i casi protegge la capacità di generalizzazione.

I fornitori e i modelli possono anche aver visto alcuni benchmark pubblici, ulteriore motivo per privilegiare casi propri.

Una valutazione come attività prodotta

Il gioco dei casi, le rubriche, le soglie e i rapporti diventano una proprietà strategica. Permettono di cambiare modello, di ottimizzare i costi e di dimostrare che una versione è migliore.

Partitech può costruire i giochi di valutazione, automatizzare i controlli, confrontare i modelli e integrare le regressioni nella catena di consegna. L'obiettivo è gestire la qualità basandosi su prove, non sull'impressione di una dimostrazione.

Parliamo del tuo progetto

Mettere in piedi una piattaforma di valutazione IA con Partitech. Contatta Partitech.

Condividi questo articolo