AI Stays Local

Tecnologia

Come il runtime adatta l'IA alla sua macchina.

Un modello che sulla carta ci sta non sempre funziona bene nella pratica. Il runtime di AI Stays Local pianifica in base all'hardware effettivamente presente, consiglia solo profili con prove registrate e mantiene l'intero ciclo di vita sulla sua macchina. Questa pagina spiega l'approccio, non i metodi interni del motore.

L'approccio

Sette principi dietro ogni profilo.

Adattamento all'hardware

Memoria, potenza di calcolo, archiviazione e accelerazione vengono lette dalla macchina. Il piano è fatto per quella macchina, non per una media, e cambia quando cambia l'hardware.

Profili di modello

Un profilo è un modello a pesi aperti specifico, a una revisione fissata e con una precisione dichiarata, con l'hardware su cui è stato valutato e ciò che la valutazione ha rilevato. È l'unità che il runtime consiglia, installa ed esegue.

Consapevolezza di memoria, calcolo e archiviazione

La memoria utilizzabile è la memoria totale meno quella che il sistema operativo trattiene. Memoria unificata, RAM di sistema e memoria della GPU dedicata sono trattate come risorse diverse, e lo spazio libero fa parte del piano.

Funzionamento locale

L'inferenza avviene sulla macchina che lei controlla. La normale inferenza locale non viene fatturata a token, e una domanda riceve risposta là dove è stata posta.

Ciclo di vita dell'esecuzione

Acquisizione, verifica, avvio, stato di salute, arresto e rimozione spettano al runtime. Un'installazione non riuscita non sostituisce un modello verificato che già funzionava.

Validazione basata sulle prove

Funzionare, essere validato, essere usabile ed essere disponibile sono fatti distinti, registrati separatamente. Un numero di parametri non viene mai trattato come prova, e ogni valore pubblicato indica il suo hardware e il suo metodo.

Un confine di privacy chiaro

Durante l'inferenza locale, richieste e documenti vengono elaborati sulla macchina. La rete viene usata per ottenere il runtime e i file del modello, i controlli di licenza non trasmettono contenuti e la telemetria è disattivata per impostazione predefinita.

Perché profili e non modelli

Lo stesso modello può essere la scelta giusta su una macchina e quella sbagliata su un'altra.

L'utilità di un modello dipende dal modello, dalla sua precisione, dalla memoria che può usare, dall'accelerazione disponibile, dalla velocità dell'archiviazione da cui viene letto e dal lavoro che gli viene chiesto. Un valore di memoria da solo dice molto poco.

Per questo il runtime consiglia profili anziché nomi di modelli. Ogni profilo porta con sé le prove che lo sostengono e uno stato per ciascuna dimensione, e la raccomandazione per una macchina viene tratta solo da profili le cui prove coprono quella classe di hardware.

Che cosa è pubblicato

Che cosa può verificare, e che cosa resta all'interno del prodotto.

  • Il profilo: modello, editore, licenza, revisione fissata e precisione.
  • L'hardware su cui è stata rilevata ogni misura, e il metodo seguito.
  • Lo stato di ogni profilo: se funziona, se è validato, se è usabile e se è disponibile.
  • Come viene verificata l'acquisizione, e che cosa accetta l'API locale.

Il modo in cui il motore colloca e sposta i dati del modello in memoria fa parte del prodotto e non è descritto su questo sito.

Confini di sicurezza e privacy (in inglese)

Riconoscimenti dovuti

Costruito su modelli aperti, citati per nome.

Ogni modello appartiene al suo editore, secondo la propria licenza. Il lavoro sui motori a monte usato dal runtime è riconosciuto nelle note del prodotto, e i risultati riportati da progetti a monte non vengono mai presentati come nostri. AI Stays Local è il livello di prodotto che sta sopra: pianificazione dell'hardware, acquisizione, orchestrazione del runtime, gestione del ciclo di vita e applicazioni. Il runtime è proprietario e non viene descritto come open source.

Note di terze parti (in inglese)