Adattamento all'hardware
Memoria, potenza di calcolo, archiviazione e accelerazione vengono lette dalla macchina. Il piano è fatto per quella macchina, non per una media, e cambia quando cambia l'hardware.
Tecnologia
Un modello che sulla carta ci sta non sempre funziona bene nella pratica. Il runtime di AI Stays Local pianifica in base all'hardware effettivamente presente, consiglia solo profili con prove registrate e mantiene l'intero ciclo di vita sulla sua macchina. Questa pagina spiega l'approccio, non i metodi interni del motore.
Memoria, potenza di calcolo, archiviazione e accelerazione vengono lette dalla macchina. Il piano è fatto per quella macchina, non per una media, e cambia quando cambia l'hardware.
Un profilo è un modello a pesi aperti specifico, a una revisione fissata e con una precisione dichiarata, con l'hardware su cui è stato valutato e ciò che la valutazione ha rilevato. È l'unità che il runtime consiglia, installa ed esegue.
La memoria utilizzabile è la memoria totale meno quella che il sistema operativo trattiene. Memoria unificata, RAM di sistema e memoria della GPU dedicata sono trattate come risorse diverse, e lo spazio libero fa parte del piano.
L'inferenza avviene sulla macchina che lei controlla. La normale inferenza locale non viene fatturata a token, e una domanda riceve risposta là dove è stata posta.
Acquisizione, verifica, avvio, stato di salute, arresto e rimozione spettano al runtime. Un'installazione non riuscita non sostituisce un modello verificato che già funzionava.
Funzionare, essere validato, essere usabile ed essere disponibile sono fatti distinti, registrati separatamente. Un numero di parametri non viene mai trattato come prova, e ogni valore pubblicato indica il suo hardware e il suo metodo.
Durante l'inferenza locale, richieste e documenti vengono elaborati sulla macchina. La rete viene usata per ottenere il runtime e i file del modello, i controlli di licenza non trasmettono contenuti e la telemetria è disattivata per impostazione predefinita.
L'utilità di un modello dipende dal modello, dalla sua precisione, dalla memoria che può usare, dall'accelerazione disponibile, dalla velocità dell'archiviazione da cui viene letto e dal lavoro che gli viene chiesto. Un valore di memoria da solo dice molto poco.
Per questo il runtime consiglia profili anziché nomi di modelli. Ogni profilo porta con sé le prove che lo sostengono e uno stato per ciascuna dimensione, e la raccomandazione per una macchina viene tratta solo da profili le cui prove coprono quella classe di hardware.
Il modo in cui il motore colloca e sposta i dati del modello in memoria fa parte del prodotto e non è descritto su questo sito.
Ogni modello appartiene al suo editore, secondo la propria licenza. Il lavoro sui motori a monte usato dal runtime è riconosciuto nelle note del prodotto, e i risultati riportati da progetti a monte non vengono mai presentati come nostri. AI Stays Local è il livello di prodotto che sta sopra: pianificazione dell'hardware, acquisizione, orchestrazione del runtime, gestione del ciclo di vita e applicazioni. Il runtime è proprietario e non viene descritto come open source.