AI Stays Local

Modelos

O que cada modelo faz, no hardware em que foi medido

Rodar, ser verificado, ser utilizável e estar disponível são quatro fatos diferentes. Cada cartão os apresenta separadamente, com o hardware em que a evidência foi obtida e quem a produziu. Cada modelo pertence ao seu editor.

O que os selos significam

Um selo vem das regras de atribuição dos próprios dados do produto, nunca de uma quantidade de parâmetros ou de uma velocidade. Hardware profissional indica onde uma medição foi feita. Não é um veredito sobre o modelo.

Nomes de modelos, medições e as frases dos próprios dados do produto aparecem exatamente como os dados canônicos do produto os registram, em inglês.

Interativo
Executado e validado pela AI Stays Local, e rápido o bastante para uma pessoa trabalhar com ele no hardware em que foi medido.
Roda
Executado pela AI Stays Local e produz saída. Não totalmente validado, e não se afirma que seja utilizável de forma interativa.
Demonstração de pesquisa
Executado e verificado pela AI Stays Local para entender o que é fisicamente possível. Lento demais para trabalhar, e não oferecido.
Demonstração de terceiros
Relatado por um projeto de terceiros. Não reproduzido pela AI Stays Local, e nunca apresentado como nosso.

Executados pela AI Stays Local

OLMoE 1B/7B

Interativo

Validated on the recorded professional hardware profile.

7B total1B active per token
Execução
Operacional
Validação
Validado
Usabilidade
Interativo
Hardware
Perfil de hardware Professional
Disponibilidade
Perfil aprovado
Evidência de
AI Stays Local
Editor
Allen Institute for AI
Licença
Apache-2.0
Fonte
allenai/OLMoE-1B-7B-0125-Instruct
Revisão fixada
b89a7c4bc24fb9e55ce2543c9458ce0ca5c4650e
Quantização
int8 merged experts (upstream conversion tool)
Checkpoint em disco
8 GB
Contexto testado
2048 tokens

O que foi verificadoCited-document workflow validated: retrieval, citation of file and location, and refusal when the indexed documents do not contain the answer.

Limitações
  • Small active model: one billion parameters participate in a token. Instruction following is inconsistent on difficult prompts.
  • No professional acceptance suite has been run, so no professional workflow claim is made.
  • The local API answers stream=true with buffered transport, so the first token arrives with the whole answer.

ProcedênciaWeights by Allen Institute for AI under Apache-2.0. Converted to int8 by the upstream Colibri conversion tool. Neither the weights nor the conversion are work of AI Stays Local.

Medição, hardware e método

Qwen3.5 122B-A10B

Interativo

Validated on the recorded professional hardware profile.

122B total10B active per token (256 experts, top-k 8, 48 layers)
Execução
Operacional
Validação
Validado
Usabilidade
Interativo
Hardware
Perfil de hardware Professional
Disponibilidade
Somente validação privada
Evidência de
AI Stays Local
Editor
Alibaba Qwen
Licença
Apache-2.0
Fonte
Qwen/Qwen3.5-122B-A10B-GPTQ-Int4
Revisão fixada
30cd92cba9707a9aba09d1e490ed4b66b78e9606
Quantização
GPTQ INT4, group size 128, symmetric; attention, shared experts, embeddings, lm_head and the vision tower are not quantised
Checkpoint em disco
79 GB
Contexto testado
8192 tokens

O que foi verificadoThirteen of thirteen functional checks, six of six product API checks and the document gates pass, including citation and refusal.

Limitações
  • No professional acceptance suite has been run, so no professional workflow claim is made.
  • Requires the machine to itself: peak unified memory 90.2 GiB.
  • No distributable profile exists. Validation was private.

ProcedênciaWeights and quantisation published by Alibaba Qwen under Apache-2.0. Served by vLLM (Apache-2.0). Neither is work of AI Stays Local; the validation is.

Medição, hardware e método

Qwen3.6 35B-A3B

Roda

Parcialmente validado. Evidência obtida em: perfil de hardware professional.

35B total3B active per token (256 experts, top-k 8)
Execução
Gera
Validação
Parcialmente validado
Usabilidade
Em lote
Hardware
Perfil de hardware Professional
Disponibilidade
Indisponível
Evidência de
AI Stays Local
Editor
Alibaba Qwen (weights); third-party conversion
Licença
Apache-2.0
Fonte
Kreuzzelg/qwen36-35b-a3b-colibri-i4-gs64
Revisão fixada
c619aa594ad1e70af82168fb6b4878427896e21c
Quantização
int4 packed, group size 64
Checkpoint em disco
24 GB
Contexto testado
2048 tokens

O que foi verificadoFour of four instruction-following checks pass. Document gates were not run against this model.

Limitações
  • Below the interactive threshold at 3.68 tokens per second.
  • The engine's OpenAI endpoint leaks a stop token into the content.
  • Document-correctness gates were not run.

ProcedênciaThird-party conversion of Qwen weights for the Colibri engine. Neither the weights nor the conversion are work of AI Stays Local. Revision c619aa594ad1e70af82168fb6b4878427896e21c established on 2026-09-21 by querying the Hugging Face model API for the repository and reading the sha field, which is the immutable commit of the default branch at that time. The licence field of the same response reported apache-2.0. The benchmark was taken before the revision was recorded, so the artifact relationship is asserted rather than proven byte for byte.

Medição, hardware e método

GLM-5.2 744B

Demonstração de pesquisa

Validated on the recorded professional hardware profile.

744B total~40B active per token (256 experts, top-k 8 plus one shared, across 75 of 78 layers)
Execução
Operacional
Validação
Validado
Usabilidade
Somente pesquisa
Hardware
Perfil de hardware Professional
Disponibilidade
Indisponível
Evidência de
AI Stays Local
Editor
Zhipu AI (weights); third-party conversion by mastouri
Licença
MIT
Fonte
mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
Revisão fixada
6bbb01ed3e515a8730b694dfae73aadfd6774581
Quantização
int4 grouped scales gs=64, int8 embeddings and lm_head, int8 MTP head
Checkpoint em disco
429 GB
Contexto testado
2048 tokens

O que foi verificadoTen of ten functional checks and eight of eight document checks pass, including resistance to a prompt injection planted in an indexed file.

Limitações
  • 0.17 tokens per second. A 200-token answer takes about 20 minutes.
  • First token at 1018 seconds on a 311-token document prompt.
  • Execution and validation are proven. Usability is research only.

ProcedênciaWeights by Zhipu AI under MIT. Container converted by a third party (mastouri) under MIT, declaring zai-org/GLM-5.2 as its base model. Engine is upstream Colibri under Apache-2.0. None of the three is work of AI Stays Local; the validation is.

Medição, hardware e método

Por finalidade

Modelos de pesos abertos, agrupados por classe.

Assistentes locais eficientes

Modelos com poucos parâmetros ativos, pensados para máquinas do dia a dia. Até agora medidos apenas em hardware profissional; o perfil de 16 GB não foi medido.

Modelos abertos profissionais

Modelos Mixture-of-Experts maiores, para máquinas com a memória e o armazenamento necessários para comportá-los.

Modelos abertos de classe de fronteira

Os maiores modelos abertos que uma máquina com muita memória consegue rodar em velocidade utilizável, segundo as evidências registradas.

Demonstrações em escala de pesquisa

Evidências do que é fisicamente possível. Não é uma capacidade do produto, e não é oferecido.

Não são evidências nossas

Relatados por terceiros, não reproduzidos aqui

Listados para que o limite fique visível. Nada nesta seção foi executado pela AI Stays Local.

Trillion-parameter MoE families

Demonstração de terceiros

Produced by the upstream project and not reproduced here.

Above one trillion, depending on familyA small fraction per token; the remainder is streamed
Execução
Não testado
Validação
Não verificado
Usabilidade
Indisponível
Hardware
Nenhuma afirmação sobre hardware
Disponibilidade
Indisponível
Evidência de
Projeto de terceiros
Editor
Various
Licença
Apache-2.0 (engine); weights vary by publisher
Fonte
github.com/JustVugg/colibri
Revisão fixada
dcd73832f293750086643e1f0ccd2cd6d067259c
Quantização
Varies
Limitações
  • Not reproduced by AI Stays Local. No first-party measurement exists.
  • No hardware claim is made: no reliable source has been verified.

ProcedênciaExecution paths described by the upstream Colibri project. AI Stays Local has not run these families.

Não existe medição própria.

O contrato de aceitação profissional

Um selo Profissional exige cada um destes 17 critérios. Taxa de processamento e quantidade de parâmetros não são critérios e não podem substituir nenhum deles. Hoje nenhum modelo cumpre o contrato, então nenhum modelo tem o selo Profissional.

  • carregamento estável do modelo
  • inicialização em tempo limitado
  • latência adequada ao fluxo de trabalho
  • inferência repetida
  • cancelamento
  • recuperação após cancelamento
  • confiabilidade da API
  • retenção de contexto
  • cumprimento de instruções
  • qualidade do idioma
  • saída estruturada
  • citações de documentos
  • recusa
  • nenhum processo remanescente
  • comportamento de memória aceitável
  • hardware documentado
  • limitações documentadas

Versão v0.3.1-product-layer dos dados do produto, resumo criptográfico do conteúdo 11797253abc9097a.

Available through a controlled private beta. Larger model profiles are added as they complete hardware validation.