AI Stays Local

Fonctionnement

Ce qui se passe vraiment sur votre ordinateur

Pas de schéma de boîtes et de flèches. Voici tout, dans l'ordre où vous le rencontreriez.

Le moteur d'exécution et les réponses citées sur documents fonctionnent pour les testeurs approuvés. L'application de bureau et l'image de conteneur sont prévues et pas encore construites. Les temps publiés ne valent que pour le matériel indiqué dans chaque benchmark.

Le produit gère la complexité

Vous choisissez le travail. AI Stays Local gère la configuration du modèle et du moteur d'exécution.

  1. Inspecter le matériel

    Le processeur, l'accélérateur, le type de mémoire, la vitesse du stockage et ce que le système d'exploitation doit garder pour lui.

  2. Recommander une configuration vérifiée

    Le profil de modèle le plus capable que cette machine peut bien faire tourner, choisi parmi des profils aux preuves publiées, avec ses limites indiquées avant tout téléchargement.

  3. Obtenir et configurer le modèle

    Depuis l'éditeur ou un dépôt approuvé, à une révision immuable, vérifié avant d'être marqué prêt, avec le moteur d'exécution configuré pour cette machine.

  4. Le faire tourner en local

    Aujourd'hui, via la ligne de commande ou l'API locale, pour des testeurs sélectionnés. L'application de bureau et l'image de conteneur sont prévues.

  1. Choisissez vos documents

    Indiquez-lui les dossiers qu'il doit connaître. Rien en dehors n'est lu, et vous pouvez retirer un dossier à tout moment.

  2. Posez vos questions naturellement

    En langage courant, comme vous le demanderiez à un collègue qui a tout lu et se souvient de tout.

  3. Obtenez des réponses avec des sources locales

    Chaque réponse tirée de vos documents indique le fichier et la page correspondants, pour que vous puissiez vérifier l'affirmation vous-même.

Tout outil d'IA utile vous demande d'abord d'envoyer vos fichiers

Cette pratique est si courante qu'on ne la perçoit plus comme une décision. Vous avez besoin d'aide sur un contrat, des notes de dossier ou les comptes d'un client, alors vous joignez le fichier, et il part vers une infrastructure qui ne vous appartient pas, selon des conditions que vous n'avez pas négociées, dans des journaux que vous ne voyez pas.

Pour la plupart des gens, la plupart du temps, c'est un échange acceptable. Pour un document que vous êtes professionnellement tenu de protéger, c'est un échange que vous n'avez peut-être pas le droit de faire. Et l'alternative a généralement été de se passer d'aide.

Le modèle peut venir au document, plutôt que l'inverse.

Pas de ferme de GPU

De grands modèles sans une salle remplie de GPU.

Un profil validé ne demande pas de ferme de GPU.

La plupart des infrastructures de grands modèles conservent d'immenses collections de poids dans la mémoire des accélérateurs. Cela donne une excellente vitesse, et exige du matériel coûteux.

Les modèles Mixture-of-Experts ouvrent une autre voie. Seul un sous-ensemble d'experts spécialisés participe à chaque token généré, de sorte qu'un moteur d'exécution adapté au matériel peut garder résidents les composants souvent utilisés et charger les autres en flux depuis le stockage NVMe local quand ils sont appelés.

Déploiement classique

  • Tous les poids du modèle en mémoire
  • Plusieurs GPU de centre de données
  • Besoin important en mémoire d'accélérateur
  • Cloud ou grappe de serveurs dédiée

Architecture AI Stays Local

  • Modèle stocké en local
  • Le routeur d'experts choisit à chaque token
  • Experts sélectionnés activés
  • RAM et calcul local
  • Experts chargés en flux depuis le NVMe
  • Accélération GPU facultative
  • Aucune grappe de GPU obligatoire
  • Aucune inférence cloud obligatoire

C'est un compromis pratique : la maîtrise locale et l'accès à des modèles bien plus grands, sans que chaque paramètre doive se trouver en même temps dans la mémoire du GPU.

Votre ordinateur
Grand modèle MoEStockage local des modèles · NVMe
Routeur d'experts
Expert 06Expert 12Expert 19
Calcul localCPU · GPU · mémoire
Réponse générée en local
Une illustration d'architecture, pas un benchmark. Un routeur sélectionne un petit sous-ensemble d'experts pour chaque token ; les autres restent sur disque jusqu'à ce qu'on en ait besoin. Les chiffres mesurés figurent sur la page des benchmarks.

Les besoins matériels et la vitesse dépendent du modèle. Les systèmes plus grands peuvent demander beaucoup de RAM et un stockage NVMe rapide, et les modèles à très grande échelle peuvent être plus lents que l'inférence cloud.

Un modèle est un fichier que l'on télécharge une fois

Ce qui surprend, c'est à quel point c'est ordinaire. Un modèle est un gros fichier : quelques gigaoctets, parfois plus. Il est sur votre disque. Quand vous posez une question, votre ordinateur effectue les calculs qui transforment votre question en réponse, au même titre qu'il effectue ceux d'un tableur. Rien n'est loué et rien n'est facturé à l'usage.

Ce que cela vous coûte, c'est de la capacité. Un modèle assez petit pour tenir sur un portable n'est pas le plus grand modèle du monde, et il perdra face à lui sur un raisonnement vraiment difficile. Ce qu'il gagne, c'est tout le reste : vos documents ne bougent pas, il fonctionne dans un avion, et personne ne vous facture chaque question.

Choisir un modèleEn local
QuotidienRecommandé pour votre MacRéponses rapides, rédaction et questions sur vos documents. Utilise environ 6 GB pendant son fonctionnement.
RéfléchiFonctionnera, mais lentementPlus à l'aise avec les longs documents et les raisonnements soignés. Demande environ 18 GB ; vous en avez 16 GB.
ApprofondiDemande plus de mémoire que cette machine n'en aPour les stations de travail et les serveurs. Disponible sur une machine de 32 GB ou plus.
Des modèles décrits par ce qu'ils font pour vous plutôt que par leur nombre de paramètres. Une illustration de l'écran de sélection prévu.
Privacy CentreEn local
Documents / Clients / 202634 fichiers indexés
Documents / Recherche212 fichiers indexés
Documents / Personnelnon lu
Autoriser les requêtes clouddésactivé

Désactiver un dossier supprime son index de cette machine.

Une illustration du Privacy Centre prévu : quels dossiers sont lisibles, ce qui est indexé et ce qui quitte la machine.

Autoriser un dossier, c'est tout le modèle d'autorisation

AI Stays Local lit ce que vous autorisez et rien d'autre. Autoriser un dossier crée un index de ce dossier sur votre machine, un index de mots qui le rend consultable. Retirer le dossier supprime cet index.

Aucun compte ne conserve vos fichiers, parce qu'il n'existe aucun compte qui conserve vos fichiers. Le Privacy Centre est conçu pour être l'écran unique qui indique d'un coup d'œil ce qui est lisible, ce qui est indexé et si quelque chose est autorisé à sortir.

Une réponse qui montre sa source

Quand une réponse vient de vos documents, elle porte le nom du fichier et le passage utilisé. Ce n'est pas une décoration. Les modèles de langage font des erreurs avec assurance, et la seule défense pratique pour qui engage sa responsabilité professionnelle, c'est de pouvoir cliquer jusqu'au paragraphe et le lire soi-même.

AI Stays Local - Clients / 2026En local

Vous

Quel préavis dois-je donner à Kaplan & Ruiz, et est-il différent de celui du contrat Nordwind ?

AI Stays Local

Trente jours pour Nordwind, soixante pour Kaplan & Ruiz. Les deux courent à partir d'un préavis écrit, et la clause Nordwind exige un envoi écrit au siège social plutôt qu'un e-mail.

Aucun des deux contrats ne permet une résiliation pour convenance au cours de la première année.

Kaplan-Ruiz-SOW.pdf p.2Nordwind-MSA.pdf p.7, p.19
Posez une question sur les 34 documents de ce dossierRépondu sur ce Mac
Une illustration de la conversation et de ses citations, dessinée pour cette page. C'est une esquisse de conception, pas une capture d'écran d'une version.

Une seule machine fait le travail

Le travail se fait sur une machine que vous contrôlez, parce que c'est là que se trouvent déjà le processeur, la mémoire et les documents. La suite ne consiste pas à disperser vos données sur davantage d'appareils, mais à permettre aux appareils auxquels vous faites déjà confiance d'atteindre la seule machine qui les détient.

  • Bureau

    L'application de bureau guidée. Prévue et pas encore construite ; aujourd'hui, le moteur d'exécution s'utilise via la ligne de commande et l'API locale.

    Prévu
  • Vos autres ordinateurs

    Accéder à la machine qui détient vos documents par votre propre réseau.

    Prévu
  • Téléphone et tablette

    Une connexion privée vers votre propre machine, plutôt qu'une seconde copie de vos données.

    Prévu
Available through a controlled private beta. Larger model profiles are added as they complete hardware validation.