I modelli i cui pesi possono essere scaricati hanno fatto progressi al punto da rendere credibili assistenti privati, trattamenti documentali, codice e alcune interazioni multimodali senza inviare tutti i dati a un'API pubblica. Parallelamente, la quantizzazione e i runtime permettono di eseguire modelli più piccoli su server compatti, workstation e talvolta su dispositivi edge.
Questa evoluzione non significa che qualsiasi modello possa essere installato su un computer portatile né che l’auto-ospitare sia automaticamente più economico. Bisogna analizzare licenza, qualità, memoria, velocità, sicurezza, aggiornamenti e gestione.
I modelli, le licenze e le offerte evolvono rapidamente; ogni riferimento deve essere convalidato nuovamente prima della pubblicazione o della scelta dell’architettura.
« Aperto » può riferirsi a diverse realtà
Un modello può pubblicare:
- i suoi pesi;
- il suo codice di inferenza;
- la sua ricetta di allenamento;
- una parte dei dati ;
- una licenza che autorizza alcuni utilizzi;
- solamente un'API.
I termini « open source », « open weights » e « disponibile per il download » non sono intercambiabili. La licenza deve essere letta per l'uso commerciale, la ridistribuzione, il fine-tuning, i settori limitati e gli obblighi di attribuzione.
Una scheda modello seria descrive architettura, limiti, lingue, valutazioni e condizioni d’uso. Non sostituisce una valutazione interna.
Perché auto-ospitare
Le motivazioni possibili sono:
- dati sensibili;
- funzionamento offline;
- latenza locale;
- costo stabile a volume elevato;
- personalizzazione;
- controllo di versione;
- reversibilità;
- esigenze industriali o geografiche.
Questi benefici hanno un prezzo: capacità GPU, team operativo, monitoraggio, sicurezza, aggiornamenti e gestione dei picchi.
I casi d'uso più realistici
Classificazione ed estrazione
Un modello compatto specializzato può classificare, normalizzare o estrarre campi con un formato vincolato. La qualità viene valutata su un corpus professionale.
RAG privato
Il modello genera a partire da un indice interno. Gli embeddings, la ricerca e il modello possono tutti essere distribuiti in un ambiente controllato.
Assistenza al codice
Un modello locale può completare, spiegare o trasformare il codice senza inviare il repository a terzi. I compiti agentici lunghi richiedono maggiore capacità e sandbox.
Elaborazione ai margini
Ispezione visiva, trascrizione, rilevamento o assistenza possono funzionare vicino alla sorgente per ridurre la latenza e mantenere un servizio senza rete.
Modalità degradato
Un'applicazione può utilizzare un modello locale per le funzioni essenziali e un'API più potente per i casi complessi quando la connessione e la politica lo consentono.
Dimensionare senza affidarsi solo al numero di parametri
Il peso in memoria dipende dalla precisione. A titolo indicativo, un parametro a 16 bit consuma due byte prima degli overhead; a 4 bit, circa mezzo byte. Il runtime, i buffer, la cache di attenzione e la concorrenza aggiungono un consumo significativo.
La lunghezza del contesto aumenta la cache KV. Il throughput dipende dalla larghezza di banda della memoria, dall’architettura e dal batch. Due modelli della stessa dimensione possono avere profili molto diversi.
Catena di qualificazione, quantificazione, distribuzione, monitoraggio e aggiornamento di un modello aperto.
Quantificazione: compromesso, non compressione gratuita
La quantificazione riduce la memoria e può accelerare l'inferenza. Può anche degradare alcune attività, lingue, calcoli o output strutturati. L'impatto varia a seconda del modello e del metodo.
È necessario confrontare la versione target sul set di valutazione, con gli stessi prompt e parametri. Una quantizzazione aggressiva può rimanere accettabile per una classificazione e insufficiente per una sintesi precisa.
Gli artefatti quantificati hanno una provenienza, un'impronta e una licenza verificate.
CPU, GPU e acceleratori edge
La CPU può essere sufficiente per un volume basso o un modello compatto, con una latenza maggiore. La GPU apporta velocità e tempi di risposta, ma crea un vincolo di memoria e di utilizzo. Gli acceleratori mobili o industriali impongono spesso formati e operatori specifici.
Il benchmark deve essere realizzato sull'hardware target. I dati pubblici utilizzano batch, contesti e ottimizzazioni che non corrispondono sempre all'uso.
Edge AI: avvicinare il calcolo ai dati
L'edge è pertinente quando:
- la rete è intermittente;
- la latenza deve essere molto bassa;
- i dati non devono lasciare il sito;
- Il volume lordo è troppo elevato;
- Una decisione locale deve continuare durante un'interruzione.
L'architettura può pretrattare localmente e poi sincronizzare i risultati. I modelli e le politiche sono firmati, versionati e distribuiti a ondate.
Un dispositivo edge ha vincoli termici, energetici e di archiviazione. Le funzioni critiche devono mantenere un fallback deterministico quando il modello non è disponibile.
Sicurezza della catena di approvvigionamento
Scaricare pesi e un runtime aggiunge artefatti esterni. Bisogna controllare:
- fonte ;
- impronta ;
- formato ;
- codice eseguito;
- dipendenze;
- vulnerabilità;
- licenza ;
- comportamento di rete;
- modello di aggiornamento.
I formati capaci di eseguire codice sono trattati con cautela. La conversione avviene in un ambiente isolato.
Sicurezza operativa
Il servizio di inferenza è autenticato, limitato e segmentato. I prompt, le uscite e le cache possono contenere dati sensibili. I log li riducono al minimo e gli accessi sono sottoposti a audit.
L’auto-ospitazione non elimina le prompt injection, l’esfiltrazione o l’abuso degli strumenti. Offre maggiore controllo sui componenti, a condizione di metterli in sicurezza.
Aggiornamento e rollback
Una nuova versione del modello può migliorare un benchmark e cambiare rifiuti, formati o usi della lingua. Essa passa per:
- qualifica di laurea ;
- scansione e conversione;
- valutazione offline ;
- test di carico ;
- canarino ;
- osservazione ;
- promozione ;
- possibilità di ritorno.
I dispositivi edge possono essere offline. Il meccanismo di aggiornamento deve gestire ripresa, firma, spazio su disco e versione minima.
Costo completo
Confrontare :
- acquisto o noleggio di capacità;
- tasso di utilizzo;
- energia ;
- raffreddamento;
- stoccaggio ;
- rete;
- supporto ;
- sicurezza;
- ingegneria ;
- rinnovo ;
- capacità di punta.
Un'API può rimanere più economica per un volume basso e irregolare. Una capacità privata diventa interessante quando l'uso è stabile, i dati sono sensibili o il controllo è strategico.
Architettura ibrida
Un ponte può instradare secondo sensibilità, complessità e disponibilità. Un piccolo modello locale gestisce i casi standard; un modello esterno prende in carico i compiti complessi autorizzati. Le valutazioni garantiscono che l'instradamento non comprometta silenziosamente la qualità.
Il formato dei prompt, degli strumenti e dei risultati è sufficientemente portatile da poter cambiare modello, mantenendo comunque le differenze esplicite.
Valutare una soluzione aperta
Il protocollo deve misurare:
- esattezza ;
- lingua ;
- formato ;
- sicurezza;
- latenza al primo token;
- flusso;
- memoria ;
- energia ;
- stabilità ;
- costo per attività riuscita.
I casi lunghi, ambigui e avversi sono inclusi. Il benchmark pubblico non sostituisce questa campagna.
Governance dei modelli
Il registro contiene nome, versione, licenza, origine, usi consentiti, proprietari, risultati della valutazione, ambienti e data di revisione. Un modello non approvato non può essere distribuito su dati sensibili.
I modelli abbandonati o vulnerabili vengono ritirati con un piano di migrazione.
Una nuova opzione di architettura
I modelli aperti e l’edge ampliano le scelte. Rendono possibile un’IA più locale, controllata e resiliente, ma richiedono una vera ingegneria di prodotto e di gestione operativa.
Partitech può confrontare i modelli, costruire il benchmark, dimensionare l'infrastruttura, integrare i runtime e mettere in piedi la catena di versione e di supervisione. L'obiettivo è un dispiegamento aperto giustificato dal bisogno, non da una promessa di gratuità.
Parliamo del tuo progetto
Valutare e prototipare un'architettura IA aperta o edge con Partitech. Contatta Partitech.