AI Stays Local

Como funciona

O que realmente acontece no seu computador

Nada de diagrama de caixas e setas. Aqui está tudo, na ordem em que você encontraria.

O runtime e as respostas com citações de documentos funcionam para testadores aprovados. O app para desktop e a imagem de contêiner estão planejados e ainda não foram construídos. Os tempos publicados valem apenas para o hardware indicado em cada benchmark.

O produto cuida da complexidade

Você escolhe o trabalho. A AI Stays Local cuida da configuração do modelo e do runtime.

  1. Inspecionar o hardware

    O processador, o acelerador, o tipo de memória, a velocidade do armazenamento e o que o sistema operacional precisa reservar para si.

  2. Recomendar uma configuração verificada

    O perfil de modelo mais capaz que aquela máquina consegue rodar bem, escolhido entre perfis com evidências publicadas, com os limites informados antes de qualquer download.

  3. Obter e configurar o modelo

    Do editor ou de um repositório aprovado, em uma revisão imutável, verificado antes de ser marcado como pronto, e com o runtime configurado para aquela máquina.

  4. Rodar localmente

    Hoje, pela linha de comando ou pela API local, para testadores selecionados. O app para desktop e a imagem de contêiner estão planejados.

  1. Escolha seus documentos

    Indique as pastas que ele deve conhecer. Nada fora delas é lido, e você pode retirar uma pasta a qualquer momento.

  2. Pergunte com naturalidade

    Em linguagem comum, do jeito que você perguntaria a alguém da equipe que leu tudo e se lembra de tudo.

  3. Respostas com fontes locais

    Toda resposta baseada nos seus documentos indica o arquivo e a página por trás dela, para que você mesmo possa conferir a afirmação.

Toda ferramenta de IA útil pede que você envie os arquivos primeiro

O padrão é tão comum que deixou de ser percebido como uma decisão. Você precisa de ajuda com um contrato, com anotações de um caso ou com os registros financeiros de um cliente, então anexa o arquivo, e ele vai para uma infraestrutura que não é sua, sob termos que você não negociou, para registros que você não pode ver.

Para a maioria das pessoas, na maior parte do tempo, é uma troca razoável. Para um documento que você tem a obrigação profissional de proteger, é uma troca que talvez você nem tenha permissão de fazer. E a alternativa costumava ser abrir mão da ajuda.

O modelo pode ir até o documento, em vez do contrário.

Sem fazenda de GPUs

Modelos grandes sem uma sala cheia de GPUs.

Um perfil validado não exige uma fazenda de GPUs.

A maior parte da infraestrutura de modelos grandes mantém enormes coleções de pesos na memória dos aceleradores. Isso gera uma velocidade excelente, e exige hardware caro.

Os modelos Mixture-of-Experts abrem outro caminho. Só um subconjunto de especialistas participa de cada token gerado, então um runtime atento ao hardware pode manter residentes os componentes mais usados e carregar os demais em streaming a partir do armazenamento NVMe local quando forem chamados.

Implantação convencional

  • Todos os pesos do modelo na memória
  • Várias GPUs de data center
  • Grande exigência de memória de acelerador
  • Nuvem ou cluster de servidores dedicado

Arquitetura da AI Stays Local

  • Modelo armazenado localmente
  • O roteador de especialistas escolhe a cada token
  • Especialistas selecionados ativados
  • RAM e processamento local
  • Streaming de especialistas a partir do NVMe
  • Aceleração por GPU opcional
  • Nenhum cluster de GPUs obrigatório
  • Nenhuma inferência em nuvem obrigatória

É uma troca prática: controle local e acesso a modelos muito maiores, sem que todos os parâmetros precisem estar na memória da GPU ao mesmo tempo.

Seu computador
Modelo MoE grandeRepositório local de modelos · NVMe
Roteador de especialistas
Especialista 06Especialista 12Especialista 19
Processamento localCPU · GPU · memória
Resposta gerada localmente
Uma ilustração da arquitetura, não um benchmark. Um roteador seleciona um pequeno subconjunto de especialistas para cada token; o restante fica no disco até ser necessário. Os números medidos estão na página de benchmarks.

Os requisitos de hardware e a velocidade dependem do modelo. Sistemas maiores podem exigir bastante RAM e armazenamento NVMe rápido, e modelos em escala extrema podem ser mais lentos que a inferência em nuvem.

Um modelo é um arquivo que você baixa uma vez

O que surpreende é o quanto isso é comum. Um modelo é um arquivo grande: alguns gigabytes, às vezes mais. Ele fica no seu disco. Quando você faz uma pergunta, o seu computador faz as contas que transformam a pergunta em resposta, no mesmo sentido em que faz as contas de uma planilha. Nada é alugado e nada é cobrado por uso.

O que isso custa é capacidade. Um modelo pequeno o bastante para caber em um notebook não é o maior modelo do mundo, e vai perder para ele em raciocínios realmente difíceis. O que ele ganha é todo o resto: seus documentos ficam onde estão, ele funciona em um avião e ninguém cobra de você por pergunta.

Escolha um modeloLocal
Dia a diaRecomendado para o seu MacRespostas rápidas, rascunhos e perguntas sobre seus documentos. Usa cerca de 6 GB enquanto está rodando.
PonderadoVai rodar, mas devagarRende mais com documentos longos e raciocínio cuidadoso. Pede cerca de 18 GB; você tem 16 GB.
ProfundoPrecisa de mais memória do que esta máquina temPara estações de trabalho e servidores. Disponível em uma máquina com 32 GB ou mais.
Modelos descritos pelo que fazem por você, e não pela quantidade de parâmetros. Uma ilustração da tela de seleção planejada.
Privacy CentreLocal
Documentos / Clientes / 202634 arquivos indexados
Documentos / Pesquisa212 arquivos indexados
Documentos / Pessoalnão lido
Permitir solicitações à nuvemdesativado

Desativar uma pasta remove o índice dela desta máquina.

Uma ilustração do Privacy Centre planejado: quais pastas podem ser lidas, o que está indexado e o que sai da máquina.

Conceder uma pasta é todo o modelo de permissões

A AI Stays Local lê o que você concede e nada mais. Conceder uma pasta cria um índice dela na sua máquina, um índice de palavras que permite pesquisar na pasta. Retirar a pasta apaga esse índice.

Não existe conta guardando seus arquivos, porque não há nenhuma conta guardando seus arquivos. O Privacy Centre foi projetado para ser a única tela que mostra, de relance, o que pode ser lido, o que está indexado e se alguma coisa tem permissão para sair.

Uma resposta que mostra a própria fonte

Quando uma resposta vem dos seus documentos, ela traz o nome do arquivo e o trecho usado. Isso não é enfeite. Modelos de linguagem erram com convicção, e a única defesa prática para quem tem obrigações profissionais em jogo é poder clicar até o parágrafo e lê-lo pessoalmente.

AI Stays Local - Clientes / 2026Local

Você

Que prazo de aviso prévio tenho que dar à Kaplan & Ruiz, e ele é diferente do contrato com a Nordwind?

AI Stays Local

Trinta dias para a Nordwind, sessenta para a Kaplan & Ruiz. Ambos contam a partir do aviso por escrito, e a cláusula da Nordwind exige que ele seja enviado por escrito ao endereço registrado, e não por e-mail.

Nenhum dos dois contratos permite rescisão por conveniência no primeiro ano.

Kaplan-Ruiz-SOW.pdf p.2Nordwind-MSA.pdf p.7, p.19
Pergunte sobre os 34 documentos desta pastaRespondido neste Mac
Uma ilustração do chat e das citações, desenhada para esta página. É um esboço de design, não uma captura de tela de um build.

Uma máquina faz o trabalho

O trabalho acontece em uma máquina que você controla, porque é lá que já estão o processador, a memória e os documentos. O plano daqui em diante não é espalhar seus dados por mais dispositivos, e sim permitir que os dispositivos em que você já confia alcancem a única máquina que os guarda.

  • Desktop

    O aplicativo para desktop guiado. Planejado e ainda não construído; hoje o runtime é usado pela linha de comando e pela API local.

    Planejado
  • Seus outros computadores

    Acessar a máquina que guarda seus documentos pela sua própria rede.

    Planejado
  • Celular e tablet

    Uma conexão privada de volta à sua própria máquina, em vez de uma segunda cópia dos seus dados.

    Planejado
Available through a controlled private beta. Larger model profiles are added as they complete hardware validation.