Adaptação ao hardware
Memória, capacidade de processamento, armazenamento e aceleração são lidos da máquina. O plano é feito para essa máquina, não para uma máquina média, e muda quando o hardware muda.
Tecnologia
Um modelo que cabe no papel nem sempre roda bem na prática. O runtime da AI Stays Local planeja em função do hardware que realmente existe, recomenda apenas perfis com evidências registradas e mantém todo o ciclo de vida na sua máquina. Esta página explica a abordagem, não os métodos internos do motor.
Memória, capacidade de processamento, armazenamento e aceleração são lidos da máquina. O plano é feito para essa máquina, não para uma máquina média, e muda quando o hardware muda.
Um perfil é um modelo de pesos abertos específico, em uma revisão fixada e com uma precisão declarada, junto com o hardware em que foi avaliado e o que a avaliação constatou. É a unidade que o runtime recomenda, instala e roda.
A memória utilizável é a memória total menos o que o sistema operacional reserva. Memória unificada, RAM do sistema e memória de GPU dedicada são tratadas como recursos diferentes, e o armazenamento livre faz parte do plano.
A inferência roda na máquina que você controla. A inferência local normal não é cobrada por token, e uma pergunta é respondida onde foi feita.
Obtenção, verificação, inicialização, verificação de integridade, parada e remoção ficam a cargo do runtime. Uma instalação que falha não substitui um modelo verificado que já estava funcionando.
Rodar, estar validado, ser utilizável e estar disponível são fatos separados, registrados separadamente. Uma contagem de parâmetros nunca é tratada como evidência, e cada número publicado indica o seu hardware e o seu método.
Durante a inferência local, prompts e documentos são processados na máquina. A rede é usada para obter o runtime e os arquivos do modelo, as verificações de licença não levam nenhum conteúdo, e a telemetria vem desativada por padrão.
Se um modelo é útil depende do modelo, da sua precisão, da memória que ele pode usar, da aceleração disponível, da velocidade do armazenamento de onde ele é lido e do trabalho que se pede a ele. Um número de memória, sozinho, prevê muito pouco.
Por isso o runtime recomenda perfis em vez de nomes de modelos. Cada perfil traz as evidências que o sustentam e um estado para cada dimensão, e a recomendação para uma máquina é tirada apenas de perfis cujas evidências cobrem essa classe de hardware.
A forma como o motor posiciona e move os dados do modelo na memória faz parte do produto e não é descrita neste site.
Cada modelo pertence ao seu editor, sob a própria licença. O trabalho de motores de terceiros usado pelo runtime é creditado nos avisos do produto, e os resultados relatados por projetos de terceiros nunca são apresentados como nossos. A AI Stays Local é a camada de produto por cima: planejamento de hardware, obtenção, orquestração do runtime, gestão do ciclo de vida e as aplicações. O runtime é proprietário e não é descrito como código aberto.