Cómo funciona
Qué ocurre realmente en su equipo
Sin diagramas de cajas y flechas. Aquí está todo, en el orden en que lo encontraría.
El entorno de ejecución y las respuestas con citas de documentos funcionan para los testers aprobados. La aplicación de escritorio y la imagen de contenedor están previstas y aún no existen. Los tiempos publicados solo se aplican al hardware indicado en cada benchmark.
Usted elige el trabajo. AI Stays Local se ocupa de configurar el modelo y el entorno de ejecución.
Inspeccionar el hardware
El procesador, el acelerador, el tipo de memoria que tiene, la velocidad del almacenamiento y lo que el sistema operativo necesita reservar para sí.
Recomendar una configuración verificada
El perfil de modelo de mayor capacidad que ese equipo puede ejecutar bien, elegido entre perfiles con evidencia publicada, con sus límites indicados antes de descargar nada.
Obtener y configurar el modelo
Desde el editor o un repositorio aprobado, en una revisión inmutable, verificado antes de marcarlo como listo, y con el entorno de ejecución configurado para ese equipo.
Ejecutarlo en local
Hoy, mediante la línea de comandos o la API local, para testers seleccionados. La aplicación de escritorio y la imagen de contenedor están previstas.
Elija sus documentos
Indique las carpetas que quiere que conozca. No se lee nada fuera de ellas, y puede retirar una carpeta en cualquier momento.
Pregunte con naturalidad
En lenguaje corriente, como preguntaría a un colega que lo ha leído todo y lo recuerda todo.
Obtenga respuestas con fuentes locales
Cada respuesta basada en sus documentos indica el archivo y la página que la respaldan, para que pueda comprobar la afirmación usted mismo.
Toda herramienta de IA útil le pide que suba primero sus archivos
El patrón es tan habitual que ha dejado de percibirse como una decisión. Necesita ayuda con un contrato, unas notas de un caso o la documentación financiera de un cliente, así que adjunta el archivo, y este va a una infraestructura que no es suya, con condiciones que no negoció, a registros que no puede ver.
Para la mayoría de las personas, la mayor parte del tiempo, es un intercambio razonable. Para un documento que usted tiene la obligación profesional de proteger, es un intercambio que quizá no le esté permitido hacer. Y la alternativa ha sido, por lo general, prescindir de la ayuda.
El modelo puede ir al documento, en lugar de lo contrario.
Modelos grandes sin una sala llena de GPU.
Un perfil validado no requiere una granja de GPU.
La mayor parte de la infraestructura de modelos grandes mantiene enormes colecciones de pesos en la memoria de los aceleradores. Eso da una velocidad excelente, y exige hardware caro.
Los modelos Mixture-of-Experts abren otro camino. Solo un subconjunto de expertos especializados participa en cada token generado, así que un entorno de ejecución consciente del hardware puede mantener residentes los componentes de uso frecuente y transmitir los demás desde el almacenamiento NVMe local cuando se necesitan.
Despliegue convencional
- Todos los pesos del modelo en memoria
- Varias GPU de centro de datos
- Gran requisito de memoria de aceleradores
- Nube o clúster de servidores dedicado
Arquitectura de AI Stays Local
- Modelo almacenado en local
- El enrutador de expertos elige por token
- Se activan los expertos seleccionados
- RAM y cómputo local
- Transmisión de expertos desde NVMe
- Aceleración por GPU opcional
- Sin clúster de GPU obligatorio
- Sin inferencia obligatoria en la nube
Es un intercambio práctico: propiedad local y acceso a modelos mucho más grandes, sin que todos los parámetros tengan que estar en la memoria de la GPU a la vez.
Los requisitos de hardware y la velocidad dependen del modelo. Los sistemas más grandes pueden requerir mucha RAM y almacenamiento NVMe rápido, y los modelos de escala extrema pueden ser más lentos que la inferencia en la nube.
Un modelo es un archivo que se descarga una vez
Lo que sorprende a la gente es lo corriente que resulta. Un modelo es un archivo grande: unos gigabytes, a veces más. Está en su disco. Cuando hace una pregunta, su equipo realiza los cálculos que convierten la pregunta en una respuesta, en el mismo sentido en que hace los cálculos de una hoja de cálculo. Nada se alquila y nada se mide por uso.
Lo que le cuesta es capacidad. Un modelo lo bastante pequeño para vivir en un portátil no es el modelo más grande del mundo, y perderá frente a uno en razonamientos realmente difíciles. Lo que gana es todo lo demás: sus documentos no se mueven, funciona en un avión y nadie le cobra por pregunta.
Desactivar una carpeta elimina su índice de este equipo.
Conceder una carpeta es todo el modelo de permisos
AI Stays Local lee lo que usted concede y nada más. Conceder una carpeta crea un índice de ella en su equipo, un índice de palabras que permite buscar en la carpeta. Retirar la carpeta elimina ese índice.
No hay ninguna cuenta que guarde sus archivos, porque no existe ninguna cuenta que guarde sus archivos. El Privacy Centre está diseñado para ser la única pantalla que responde, de un vistazo, qué se puede leer, qué está indexado y si hay algo autorizado a salir.
Una respuesta que muestra su fuente
Cuando una respuesta procede de sus documentos, lleva el nombre del archivo y el pasaje que utilizó. No es un adorno. Los modelos de lenguaje cometen errores con seguridad, y la única defensa práctica para alguien cuyas obligaciones profesionales están en juego es poder hacer clic hasta el párrafo y leerlo usted mismo.
Usted
¿Qué plazo de preaviso tengo que dar a Kaplan & Ruiz, y es distinto del del contrato con Nordwind?
AI Stays Local
Treinta días para Nordwind, sesenta para Kaplan & Ruiz. Ambos se cuentan desde el aviso por escrito, y la cláusula de Nordwind exige que se envíe por escrito al domicilio social, no por correo electrónico.
Ninguno de los dos contratos permite la rescisión por conveniencia durante el primer año.
Una sola máquina hace el trabajo
El trabajo se hace en una máquina que usted controla, porque ahí es donde ya están el procesador, la memoria y los documentos. El plan más allá de eso no es repartir sus datos entre más dispositivos, sino permitir que los dispositivos en los que ya confía lleguen a la única máquina que los guarda.
Escritorio
La aplicación de escritorio guiada. Prevista y aún no construida; hoy el entorno de ejecución se usa mediante la línea de comandos y la API local.
PrevistoSus otros equipos
Acceder a la máquina que guarda sus documentos a través de su propia red.
PrevistoTeléfono y tableta
Una conexión privada de vuelta a su propia máquina, en lugar de una segunda copia de sus datos.
Previsto