Fonctionnement
Ce qui se passe vraiment sur votre ordinateur
Pas de schéma de boîtes et de flèches. Voici tout, dans l'ordre où vous le rencontreriez.
Le moteur d'exécution et les réponses citées sur documents fonctionnent pour les testeurs approuvés. L'application de bureau et l'image de conteneur sont prévues et pas encore construites. Les temps publiés ne valent que pour le matériel indiqué dans chaque benchmark.
Vous choisissez le travail. AI Stays Local gère la configuration du modèle et du moteur d'exécution.
Inspecter le matériel
Le processeur, l'accélérateur, le type de mémoire, la vitesse du stockage et ce que le système d'exploitation doit garder pour lui.
Recommander une configuration vérifiée
Le profil de modèle le plus capable que cette machine peut bien faire tourner, choisi parmi des profils aux preuves publiées, avec ses limites indiquées avant tout téléchargement.
Obtenir et configurer le modèle
Depuis l'éditeur ou un dépôt approuvé, à une révision immuable, vérifié avant d'être marqué prêt, avec le moteur d'exécution configuré pour cette machine.
Le faire tourner en local
Aujourd'hui, via la ligne de commande ou l'API locale, pour des testeurs sélectionnés. L'application de bureau et l'image de conteneur sont prévues.
Choisissez vos documents
Indiquez-lui les dossiers qu'il doit connaître. Rien en dehors n'est lu, et vous pouvez retirer un dossier à tout moment.
Posez vos questions naturellement
En langage courant, comme vous le demanderiez à un collègue qui a tout lu et se souvient de tout.
Obtenez des réponses avec des sources locales
Chaque réponse tirée de vos documents indique le fichier et la page correspondants, pour que vous puissiez vérifier l'affirmation vous-même.
Tout outil d'IA utile vous demande d'abord d'envoyer vos fichiers
Cette pratique est si courante qu'on ne la perçoit plus comme une décision. Vous avez besoin d'aide sur un contrat, des notes de dossier ou les comptes d'un client, alors vous joignez le fichier, et il part vers une infrastructure qui ne vous appartient pas, selon des conditions que vous n'avez pas négociées, dans des journaux que vous ne voyez pas.
Pour la plupart des gens, la plupart du temps, c'est un échange acceptable. Pour un document que vous êtes professionnellement tenu de protéger, c'est un échange que vous n'avez peut-être pas le droit de faire. Et l'alternative a généralement été de se passer d'aide.
Le modèle peut venir au document, plutôt que l'inverse.
De grands modèles sans une salle remplie de GPU.
Un profil validé ne demande pas de ferme de GPU.
La plupart des infrastructures de grands modèles conservent d'immenses collections de poids dans la mémoire des accélérateurs. Cela donne une excellente vitesse, et exige du matériel coûteux.
Les modèles Mixture-of-Experts ouvrent une autre voie. Seul un sous-ensemble d'experts spécialisés participe à chaque token généré, de sorte qu'un moteur d'exécution adapté au matériel peut garder résidents les composants souvent utilisés et charger les autres en flux depuis le stockage NVMe local quand ils sont appelés.
Déploiement classique
- Tous les poids du modèle en mémoire
- Plusieurs GPU de centre de données
- Besoin important en mémoire d'accélérateur
- Cloud ou grappe de serveurs dédiée
Architecture AI Stays Local
- Modèle stocké en local
- Le routeur d'experts choisit à chaque token
- Experts sélectionnés activés
- RAM et calcul local
- Experts chargés en flux depuis le NVMe
- Accélération GPU facultative
- Aucune grappe de GPU obligatoire
- Aucune inférence cloud obligatoire
C'est un compromis pratique : la maîtrise locale et l'accès à des modèles bien plus grands, sans que chaque paramètre doive se trouver en même temps dans la mémoire du GPU.
Les besoins matériels et la vitesse dépendent du modèle. Les systèmes plus grands peuvent demander beaucoup de RAM et un stockage NVMe rapide, et les modèles à très grande échelle peuvent être plus lents que l'inférence cloud.
Un modèle est un fichier que l'on télécharge une fois
Ce qui surprend, c'est à quel point c'est ordinaire. Un modèle est un gros fichier : quelques gigaoctets, parfois plus. Il est sur votre disque. Quand vous posez une question, votre ordinateur effectue les calculs qui transforment votre question en réponse, au même titre qu'il effectue ceux d'un tableur. Rien n'est loué et rien n'est facturé à l'usage.
Ce que cela vous coûte, c'est de la capacité. Un modèle assez petit pour tenir sur un portable n'est pas le plus grand modèle du monde, et il perdra face à lui sur un raisonnement vraiment difficile. Ce qu'il gagne, c'est tout le reste : vos documents ne bougent pas, il fonctionne dans un avion, et personne ne vous facture chaque question.
Désactiver un dossier supprime son index de cette machine.
Autoriser un dossier, c'est tout le modèle d'autorisation
AI Stays Local lit ce que vous autorisez et rien d'autre. Autoriser un dossier crée un index de ce dossier sur votre machine, un index de mots qui le rend consultable. Retirer le dossier supprime cet index.
Aucun compte ne conserve vos fichiers, parce qu'il n'existe aucun compte qui conserve vos fichiers. Le Privacy Centre est conçu pour être l'écran unique qui indique d'un coup d'œil ce qui est lisible, ce qui est indexé et si quelque chose est autorisé à sortir.
Une réponse qui montre sa source
Quand une réponse vient de vos documents, elle porte le nom du fichier et le passage utilisé. Ce n'est pas une décoration. Les modèles de langage font des erreurs avec assurance, et la seule défense pratique pour qui engage sa responsabilité professionnelle, c'est de pouvoir cliquer jusqu'au paragraphe et le lire soi-même.
Vous
Quel préavis dois-je donner à Kaplan & Ruiz, et est-il différent de celui du contrat Nordwind ?
AI Stays Local
Trente jours pour Nordwind, soixante pour Kaplan & Ruiz. Les deux courent à partir d'un préavis écrit, et la clause Nordwind exige un envoi écrit au siège social plutôt qu'un e-mail.
Aucun des deux contrats ne permet une résiliation pour convenance au cours de la première année.
Une seule machine fait le travail
Le travail se fait sur une machine que vous contrôlez, parce que c'est là que se trouvent déjà le processeur, la mémoire et les documents. La suite ne consiste pas à disperser vos données sur davantage d'appareils, mais à permettre aux appareils auxquels vous faites déjà confiance d'atteindre la seule machine qui les détient.
Bureau
L'application de bureau guidée. Prévue et pas encore construite ; aujourd'hui, le moteur d'exécution s'utilise via la ligne de commande et l'API locale.
PrévuVos autres ordinateurs
Accéder à la machine qui détient vos documents par votre propre réseau.
PrévuTéléphone et tablette
Une connexion privée vers votre propre machine, plutôt qu'une seconde copie de vos données.
Prévu