AI Stays Local

Cómo funciona

Qué ocurre realmente en su equipo

Sin diagramas de cajas y flechas. Aquí está todo, en el orden en que lo encontraría.

El entorno de ejecución y las respuestas con citas de documentos funcionan para los testers aprobados. La aplicación de escritorio y la imagen de contenedor están previstas y aún no existen. Los tiempos publicados solo se aplican al hardware indicado en cada benchmark.

El producto se ocupa de la complejidad

Usted elige el trabajo. AI Stays Local se ocupa de configurar el modelo y el entorno de ejecución.

  1. Inspeccionar el hardware

    El procesador, el acelerador, el tipo de memoria que tiene, la velocidad del almacenamiento y lo que el sistema operativo necesita reservar para sí.

  2. Recomendar una configuración verificada

    El perfil de modelo de mayor capacidad que ese equipo puede ejecutar bien, elegido entre perfiles con evidencia publicada, con sus límites indicados antes de descargar nada.

  3. Obtener y configurar el modelo

    Desde el editor o un repositorio aprobado, en una revisión inmutable, verificado antes de marcarlo como listo, y con el entorno de ejecución configurado para ese equipo.

  4. Ejecutarlo en local

    Hoy, mediante la línea de comandos o la API local, para testers seleccionados. La aplicación de escritorio y la imagen de contenedor están previstas.

  1. Elija sus documentos

    Indique las carpetas que quiere que conozca. No se lee nada fuera de ellas, y puede retirar una carpeta en cualquier momento.

  2. Pregunte con naturalidad

    En lenguaje corriente, como preguntaría a un colega que lo ha leído todo y lo recuerda todo.

  3. Obtenga respuestas con fuentes locales

    Cada respuesta basada en sus documentos indica el archivo y la página que la respaldan, para que pueda comprobar la afirmación usted mismo.

Toda herramienta de IA útil le pide que suba primero sus archivos

El patrón es tan habitual que ha dejado de percibirse como una decisión. Necesita ayuda con un contrato, unas notas de un caso o la documentación financiera de un cliente, así que adjunta el archivo, y este va a una infraestructura que no es suya, con condiciones que no negoció, a registros que no puede ver.

Para la mayoría de las personas, la mayor parte del tiempo, es un intercambio razonable. Para un documento que usted tiene la obligación profesional de proteger, es un intercambio que quizá no le esté permitido hacer. Y la alternativa ha sido, por lo general, prescindir de la ayuda.

El modelo puede ir al documento, en lugar de lo contrario.

Sin granja de GPU

Modelos grandes sin una sala llena de GPU.

Un perfil validado no requiere una granja de GPU.

La mayor parte de la infraestructura de modelos grandes mantiene enormes colecciones de pesos en la memoria de los aceleradores. Eso da una velocidad excelente, y exige hardware caro.

Los modelos Mixture-of-Experts abren otro camino. Solo un subconjunto de expertos especializados participa en cada token generado, así que un entorno de ejecución consciente del hardware puede mantener residentes los componentes de uso frecuente y transmitir los demás desde el almacenamiento NVMe local cuando se necesitan.

Despliegue convencional

  • Todos los pesos del modelo en memoria
  • Varias GPU de centro de datos
  • Gran requisito de memoria de aceleradores
  • Nube o clúster de servidores dedicado

Arquitectura de AI Stays Local

  • Modelo almacenado en local
  • El enrutador de expertos elige por token
  • Se activan los expertos seleccionados
  • RAM y cómputo local
  • Transmisión de expertos desde NVMe
  • Aceleración por GPU opcional
  • Sin clúster de GPU obligatorio
  • Sin inferencia obligatoria en la nube

Es un intercambio práctico: propiedad local y acceso a modelos mucho más grandes, sin que todos los parámetros tengan que estar en la memoria de la GPU a la vez.

Su equipo
Modelo MoE grandeAlmacén local de modelos · NVMe
Enrutador de expertos
Experto 06Experto 12Experto 19
Cómputo localCPU · GPU · memoria
Respuesta generada en local
Una ilustración de la arquitectura, no un benchmark. Un enrutador selecciona un pequeño subconjunto de expertos para cada token; el resto permanece en disco hasta que se necesita. Las cifras medidas están en la página de benchmarks.

Los requisitos de hardware y la velocidad dependen del modelo. Los sistemas más grandes pueden requerir mucha RAM y almacenamiento NVMe rápido, y los modelos de escala extrema pueden ser más lentos que la inferencia en la nube.

Un modelo es un archivo que se descarga una vez

Lo que sorprende a la gente es lo corriente que resulta. Un modelo es un archivo grande: unos gigabytes, a veces más. Está en su disco. Cuando hace una pregunta, su equipo realiza los cálculos que convierten la pregunta en una respuesta, en el mismo sentido en que hace los cálculos de una hoja de cálculo. Nada se alquila y nada se mide por uso.

Lo que le cuesta es capacidad. Un modelo lo bastante pequeño para vivir en un portátil no es el modelo más grande del mundo, y perderá frente a uno en razonamientos realmente difíciles. Lo que gana es todo lo demás: sus documentos no se mueven, funciona en un avión y nadie le cobra por pregunta.

Elija un modeloLocal
CotidianoRecomendado para su MacRespuestas rápidas, redacción y preguntas sobre sus documentos. Usa unos 6 GB mientras se ejecuta.
ReflexivoFuncionará, pero despacioRinde más con documentos largos y razonamientos cuidadosos. Pide unos 18 GB; usted tiene 16 GB.
ProfundoNecesita más memoria de la que tiene este equipoPara estaciones de trabajo y servidores. Disponible en un equipo con 32 GB o más.
Modelos descritos por lo que hacen por usted y no por su número de parámetros. Una ilustración de la pantalla de selección prevista.
Privacy CentreLocal
Documentos / Clientes / 202634 archivos indexados
Documentos / Investigación212 archivos indexados
Documentos / Personalno se lee
Permitir solicitudes a la nubedesactivado

Desactivar una carpeta elimina su índice de este equipo.

Una ilustración del Privacy Centre previsto: qué carpetas se pueden leer, qué está indexado y qué sale del equipo.

Conceder una carpeta es todo el modelo de permisos

AI Stays Local lee lo que usted concede y nada más. Conceder una carpeta crea un índice de ella en su equipo, un índice de palabras que permite buscar en la carpeta. Retirar la carpeta elimina ese índice.

No hay ninguna cuenta que guarde sus archivos, porque no existe ninguna cuenta que guarde sus archivos. El Privacy Centre está diseñado para ser la única pantalla que responde, de un vistazo, qué se puede leer, qué está indexado y si hay algo autorizado a salir.

Una respuesta que muestra su fuente

Cuando una respuesta procede de sus documentos, lleva el nombre del archivo y el pasaje que utilizó. No es un adorno. Los modelos de lenguaje cometen errores con seguridad, y la única defensa práctica para alguien cuyas obligaciones profesionales están en juego es poder hacer clic hasta el párrafo y leerlo usted mismo.

AI Stays Local - Clientes / 2026Local

Usted

¿Qué plazo de preaviso tengo que dar a Kaplan & Ruiz, y es distinto del del contrato con Nordwind?

AI Stays Local

Treinta días para Nordwind, sesenta para Kaplan & Ruiz. Ambos se cuentan desde el aviso por escrito, y la cláusula de Nordwind exige que se envíe por escrito al domicilio social, no por correo electrónico.

Ninguno de los dos contratos permite la rescisión por conveniencia durante el primer año.

Kaplan-Ruiz-SOW.pdf p.2Nordwind-MSA.pdf p.7, p.19
Pregunte sobre los 34 documentos de esta carpetaRespondido en este Mac
Una ilustración del chat y sus citas, dibujada para esta página. Es un boceto de diseño, no una captura de una compilación.

Una sola máquina hace el trabajo

El trabajo se hace en una máquina que usted controla, porque ahí es donde ya están el procesador, la memoria y los documentos. El plan más allá de eso no es repartir sus datos entre más dispositivos, sino permitir que los dispositivos en los que ya confía lleguen a la única máquina que los guarda.

  • Escritorio

    La aplicación de escritorio guiada. Prevista y aún no construida; hoy el entorno de ejecución se usa mediante la línea de comandos y la API local.

    Previsto
  • Sus otros equipos

    Acceder a la máquina que guarda sus documentos a través de su propia red.

    Previsto
  • Teléfono y tableta

    Una conexión privada de vuelta a su propia máquina, en lugar de una segunda copia de sus datos.

    Previsto
Available through a controlled private beta. Larger model profiles are added as they complete hardware validation.