Adaptation au matériel
La mémoire, la puissance de calcul, le stockage et l'accélération sont lus sur la machine. Le plan est établi pour cette machine, pas pour une machine moyenne, et il change quand le matériel change.
Technologie
Un modèle qui tient sur le papier ne fonctionne pas toujours bien en pratique. Le moteur d'exécution AI Stays Local planifie en fonction du matériel réellement présent, ne recommande que des profils disposant de preuves enregistrées et garde tout le cycle de vie sur votre machine. Cette page explique l'approche, pas les méthodes internes du moteur.
La mémoire, la puissance de calcul, le stockage et l'accélération sont lus sur la machine. Le plan est établi pour cette machine, pas pour une machine moyenne, et il change quand le matériel change.
Un profil est un modèle à poids ouverts précis, à une révision figée et une précision indiquée, avec le matériel sur lequel il a été évalué et ce que l'évaluation a constaté. C'est l'unité que le moteur d'exécution recommande, installe et fait tourner.
La mémoire utilisable est la mémoire totale moins ce que le système d'exploitation conserve. La mémoire unifiée, la RAM système et la mémoire d'un GPU dédié sont traitées comme des ressources différentes, et le stockage libre fait partie du plan.
L'inférence s'exécute sur la machine que vous contrôlez. L'inférence locale normale n'est pas facturée au token, et une question reçoit sa réponse là où elle a été posée.
L'obtention, la vérification, le démarrage, l'état de santé, l'arrêt et la suppression relèvent du moteur d'exécution. Une installation qui échoue ne remplace pas un modèle vérifié qui fonctionnait déjà.
Fonctionner, être validé, être utilisable et être disponible sont des faits distincts, enregistrés séparément. Un nombre de paramètres n'est jamais considéré comme une preuve, et chaque chiffre publié indique son matériel et sa méthode.
Les requêtes et les documents sont traités sur la machine pendant l'inférence locale. Le réseau sert à obtenir le moteur d'exécution et les fichiers de modèle, les vérifications de licence ne transmettent aucun contenu, et la télémétrie est désactivée par défaut.
L'utilité d'un modèle dépend du modèle, de sa précision, de la mémoire qu'il peut utiliser, de l'accélération disponible, de la vitesse du stockage depuis lequel il est lu et du travail qu'on lui demande. Un chiffre de mémoire, à lui seul, prédit très peu de chose.
Le moteur d'exécution recommande donc des profils plutôt que des noms de modèles. Chaque profil porte les preuves qui le justifient et un état pour chaque dimension, et la recommandation pour une machine n'est tirée que de profils dont les preuves couvrent cette classe de matériel.
La façon dont le moteur place et déplace les données du modèle en mémoire fait partie du produit et n'est pas décrite sur ce site.
Chaque modèle appartient à son éditeur, sous sa propre licence. Les travaux amont sur les moteurs utilisés par le moteur d'exécution sont crédités dans les mentions du produit, et les résultats publiés par des projets amont ne sont jamais présentés comme les nôtres. AI Stays Local est la couche produit par-dessus : planification matérielle, obtention, orchestration du moteur d'exécution, gestion du cycle de vie et applications. Le moteur d'exécution est propriétaire et n'est pas présenté comme open source.