AI Stays Local

Tecnologia

Como o runtime adapta a IA à sua máquina.

Um modelo que cabe no papel nem sempre roda bem na prática. O runtime da AI Stays Local planeja em função do hardware que realmente existe, recomenda apenas perfis com evidências registradas e mantém todo o ciclo de vida na sua máquina. Esta página explica a abordagem, não os métodos internos do motor.

A abordagem

Sete princípios por trás de cada perfil.

Adaptação ao hardware

Memória, capacidade de processamento, armazenamento e aceleração são lidos da máquina. O plano é feito para essa máquina, não para uma máquina média, e muda quando o hardware muda.

Perfis de modelo

Um perfil é um modelo de pesos abertos específico, em uma revisão fixada e com uma precisão declarada, junto com o hardware em que foi avaliado e o que a avaliação constatou. É a unidade que o runtime recomenda, instala e roda.

Atenção à memória, ao processamento e ao armazenamento

A memória utilizável é a memória total menos o que o sistema operacional reserva. Memória unificada, RAM do sistema e memória de GPU dedicada são tratadas como recursos diferentes, e o armazenamento livre faz parte do plano.

Operação local

A inferência roda na máquina que você controla. A inferência local normal não é cobrada por token, e uma pergunta é respondida onde foi feita.

Ciclo de vida de execução

Obtenção, verificação, inicialização, verificação de integridade, parada e remoção ficam a cargo do runtime. Uma instalação que falha não substitui um modelo verificado que já estava funcionando.

Validação baseada em evidências

Rodar, estar validado, ser utilizável e estar disponível são fatos separados, registrados separadamente. Uma contagem de parâmetros nunca é tratada como evidência, e cada número publicado indica o seu hardware e o seu método.

Um limite de privacidade claro

Durante a inferência local, prompts e documentos são processados na máquina. A rede é usada para obter o runtime e os arquivos do modelo, as verificações de licença não levam nenhum conteúdo, e a telemetria vem desativada por padrão.

Por que perfis, e não modelos

O mesmo modelo pode ser a escolha certa em uma máquina e a errada em outra.

Se um modelo é útil depende do modelo, da sua precisão, da memória que ele pode usar, da aceleração disponível, da velocidade do armazenamento de onde ele é lido e do trabalho que se pede a ele. Um número de memória, sozinho, prevê muito pouco.

Por isso o runtime recomenda perfis em vez de nomes de modelos. Cada perfil traz as evidências que o sustentam e um estado para cada dimensão, e a recomendação para uma máquina é tirada apenas de perfis cujas evidências cobrem essa classe de hardware.

O que é publicado

O que você pode conferir, e o que fica dentro do produto.

  • O perfil: modelo, editor, licença, revisão fixada e precisão.
  • O hardware em que cada medição foi feita, e o método por trás dela.
  • O estado de cada perfil: se roda, se está validado, se é utilizável e se está disponível.
  • Como a obtenção é verificada, e o que a API local aceita.

A forma como o motor posiciona e move os dados do modelo na memória faz parte do produto e não é descrita neste site.

Limites de segurança e privacidade (em inglês)

Crédito a quem é devido

Construído sobre modelos abertos, creditados pelo nome.

Cada modelo pertence ao seu editor, sob a própria licença. O trabalho de motores de terceiros usado pelo runtime é creditado nos avisos do produto, e os resultados relatados por projetos de terceiros nunca são apresentados como nossos. A AI Stays Local é a camada de produto por cima: planejamento de hardware, obtenção, orquestração do runtime, gestão do ciclo de vida e as aplicações. O runtime é proprietário e não é descrito como código aberto.

Avisos de terceiros (em inglês)