AI Stays Local

Modèles

Ce que fait chaque modèle, sur le matériel où il a été mesuré

Tourner, être vérifié, être utilisable et être disponible sont quatre faits distincts. Chaque fiche les indique séparément, avec le matériel sur lequel les preuves ont été recueillies et qui les a produites. Chaque modèle appartient à son éditeur.

Ce que signifient les badges

Un badge découle des règles d'attribution propres aux données produit, jamais d'un nombre de paramètres ni d'une vitesse. Le matériel professionnel indique où une mesure a été prise. Ce n'est pas un verdict sur le modèle.

Les noms de modèles, les mesures et les phrases propres aux données produit sont affichés exactement tels que les données canoniques du produit les enregistrent, en anglais.

Interactif
Exécuté et validé par AI Stays Local, et assez rapide pour qu'une personne travaille avec, sur le matériel où il a été mesuré.
Tourne
Exécuté par AI Stays Local et produit un résultat. Pas entièrement validé, et pas présenté comme utilisable en interactif.
Démonstration de recherche
Exécuté et vérifié par AI Stays Local pour savoir ce qui est physiquement possible. Trop lent pour travailler avec, et non proposé.
Démonstration amont
Rapporté par un projet amont. Non reproduit par AI Stays Local, et jamais présenté comme le nôtre.

Exécutés par AI Stays Local

OLMoE 1B/7B

Interactif

Validated on the recorded professional hardware profile.

7B total1B active per token
Exécution
Opérationnel
Validation
Validé
Utilisabilité
Interactif
Matériel
Profil matériel Professional
Disponibilité
Profil approuvé
Preuves fournies par
AI Stays Local
Éditeur
Allen Institute for AI
Licence
Apache-2.0
Source
allenai/OLMoE-1B-7B-0125-Instruct
Révision figée
b89a7c4bc24fb9e55ce2543c9458ce0ca5c4650e
Quantification
int8 merged experts (upstream conversion tool)
Checkpoint sur disque
8 GB
Contexte testé
2048 tokens

Ce qui a été vérifiéCited-document workflow validated: retrieval, citation of file and location, and refusal when the indexed documents do not contain the answer.

Limites
  • Small active model: one billion parameters participate in a token. Instruction following is inconsistent on difficult prompts.
  • No professional acceptance suite has been run, so no professional workflow claim is made.
  • The local API answers stream=true with buffered transport, so the first token arrives with the whole answer.

ProvenanceWeights by Allen Institute for AI under Apache-2.0. Converted to int8 by the upstream Colibri conversion tool. Neither the weights nor the conversion are work of AI Stays Local.

Mesure, matériel et méthode

Qwen3.5 122B-A10B

Interactif

Validated on the recorded professional hardware profile.

122B total10B active per token (256 experts, top-k 8, 48 layers)
Exécution
Opérationnel
Validation
Validé
Utilisabilité
Interactif
Matériel
Profil matériel Professional
Disponibilité
Validation privée uniquement
Preuves fournies par
AI Stays Local
Éditeur
Alibaba Qwen
Licence
Apache-2.0
Source
Qwen/Qwen3.5-122B-A10B-GPTQ-Int4
Révision figée
30cd92cba9707a9aba09d1e490ed4b66b78e9606
Quantification
GPTQ INT4, group size 128, symmetric; attention, shared experts, embeddings, lm_head and the vision tower are not quantised
Checkpoint sur disque
79 GB
Contexte testé
8192 tokens

Ce qui a été vérifiéThirteen of thirteen functional checks, six of six product API checks and the document gates pass, including citation and refusal.

Limites
  • No professional acceptance suite has been run, so no professional workflow claim is made.
  • Requires the machine to itself: peak unified memory 90.2 GiB.
  • No distributable profile exists. Validation was private.

ProvenanceWeights and quantisation published by Alibaba Qwen under Apache-2.0. Served by vLLM (Apache-2.0). Neither is work of AI Stays Local; the validation is.

Mesure, matériel et méthode

Qwen3.6 35B-A3B

Tourne

Partiellement validé. Preuves recueillies sur le profil matériel professional.

35B total3B active per token (256 experts, top-k 8)
Exécution
Génère
Validation
Partiellement validé
Utilisabilité
Par lots
Matériel
Profil matériel Professional
Disponibilité
Indisponible
Preuves fournies par
AI Stays Local
Éditeur
Alibaba Qwen (weights); third-party conversion
Licence
Apache-2.0
Source
Kreuzzelg/qwen36-35b-a3b-colibri-i4-gs64
Révision figée
c619aa594ad1e70af82168fb6b4878427896e21c
Quantification
int4 packed, group size 64
Checkpoint sur disque
24 GB
Contexte testé
2048 tokens

Ce qui a été vérifiéFour of four instruction-following checks pass. Document gates were not run against this model.

Limites
  • Below the interactive threshold at 3.68 tokens per second.
  • The engine's OpenAI endpoint leaks a stop token into the content.
  • Document-correctness gates were not run.

ProvenanceThird-party conversion of Qwen weights for the Colibri engine. Neither the weights nor the conversion are work of AI Stays Local. Revision c619aa594ad1e70af82168fb6b4878427896e21c established on 2026-09-21 by querying the Hugging Face model API for the repository and reading the sha field, which is the immutable commit of the default branch at that time. The licence field of the same response reported apache-2.0. The benchmark was taken before the revision was recorded, so the artifact relationship is asserted rather than proven byte for byte.

Mesure, matériel et méthode

GLM-5.2 744B

Démonstration de recherche

Validated on the recorded professional hardware profile.

744B total~40B active per token (256 experts, top-k 8 plus one shared, across 75 of 78 layers)
Exécution
Opérationnel
Validation
Validé
Utilisabilité
Recherche uniquement
Matériel
Profil matériel Professional
Disponibilité
Indisponible
Preuves fournies par
AI Stays Local
Éditeur
Zhipu AI (weights); third-party conversion by mastouri
Licence
MIT
Source
mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
Révision figée
6bbb01ed3e515a8730b694dfae73aadfd6774581
Quantification
int4 grouped scales gs=64, int8 embeddings and lm_head, int8 MTP head
Checkpoint sur disque
429 GB
Contexte testé
2048 tokens

Ce qui a été vérifiéTen of ten functional checks and eight of eight document checks pass, including resistance to a prompt injection planted in an indexed file.

Limites
  • 0.17 tokens per second. A 200-token answer takes about 20 minutes.
  • First token at 1018 seconds on a 311-token document prompt.
  • Execution and validation are proven. Usability is research only.

ProvenanceWeights by Zhipu AI under MIT. Container converted by a third party (mastouri) under MIT, declaring zai-org/GLM-5.2 as its base model. Engine is upstream Colibri under Apache-2.0. None of the three is work of AI Stays Local; the validation is.

Mesure, matériel et méthode

Selon leur usage

Modèles à poids ouverts, regroupés par classe.

Assistants locaux efficaces

Des modèles à faible nombre de paramètres actifs, pensés pour les machines du quotidien. Mesurés jusqu'ici sur du matériel professionnel uniquement ; le profil de 16 GB n'a pas été mesuré.

Modèles ouverts professionnels

Des modèles à mélange d'experts plus grands, pour les machines qui ont la mémoire et le stockage nécessaires.

Modèles ouverts de classe frontière

Les plus grands modèles ouverts qu'une machine dotée de beaucoup de mémoire peut faire tourner à une vitesse utilisable, d'après les preuves enregistrées.

Démonstrations à l'échelle de la recherche

Des preuves de ce qui est physiquement possible. Pas une capacité du produit, et non proposé.

Pas nos preuves

Rapporté en amont, non reproduit ici

Listé pour que la limite soit visible. Rien dans cette section n'a été exécuté par AI Stays Local.

Trillion-parameter MoE families

Démonstration amont

Produced by the upstream project and not reproduced here.

Above one trillion, depending on familyA small fraction per token; the remainder is streamed
Exécution
Non testé
Validation
Non vérifié
Utilisabilité
Indisponible
Matériel
Aucune affirmation matérielle
Disponibilité
Indisponible
Preuves fournies par
Projet amont
Éditeur
Various
Licence
Apache-2.0 (engine); weights vary by publisher
Source
github.com/JustVugg/colibri
Révision figée
dcd73832f293750086643e1f0ccd2cd6d067259c
Quantification
Varies
Limites
  • Not reproduced by AI Stays Local. No first-party measurement exists.
  • No hardware claim is made: no reliable source has been verified.

ProvenanceExecution paths described by the upstream Colibri project. AI Stays Local has not run these families.

Aucune mesure propre n'existe.

Le contrat d'acceptation professionnelle

Un badge Professionnel exige de passer chacun de ces 17 critères. Le débit et le nombre de paramètres ne sont pas des critères et ne peuvent en remplacer aucun. Aucun modèle ne remplit le contrat aujourd'hui, donc aucun modèle ne porte le badge Professionnel.

  • chargement stable du modèle
  • démarrage en temps borné
  • latence adaptée au flux de travail
  • inférence répétée
  • annulation
  • reprise après annulation
  • fiabilité de l'API
  • conservation du contexte
  • respect des instructions
  • qualité de la langue
  • sortie structurée
  • citations de documents
  • refus
  • aucun processus résiduel
  • comportement mémoire acceptable
  • matériel documenté
  • limites documentées

Version v0.3.1-product-layer des données produit, empreinte du contenu 11797253abc9097a.

Available through a controlled private beta. Larger model profiles are added as they complete hardware validation.