工作原理
您的电脑上实际发生了什么
没有方框和箭头的示意图。下面按您会遇到的顺序,完整说明一遍。
运行时和附引用的文档回答已向获批的测试者开放。桌面应用和容器镜像仍在计划中,尚未构建。公布的耗时数据只适用于各项基准测试所注明的硬件。
您选择要做的工作。模型和运行时的配置由 AI Stays Local 处理。
检查硬件
处理器、加速器、内存类型、存储速度,以及操作系统需要为自己保留多少。
推荐经过验证的配置
从有公开证据的配置档中,选出这台机器能良好运行的能力最强的模型配置档,并在下载任何内容之前说明其限制。
获取并配置模型
从发布者或获准的仓库,以不可变的修订版本获取,在标记为就绪之前完成验证,并为这台机器配置好运行时。
在本地运行
目前入选的测试者可以通过命令行或本地 API 使用。桌面应用和容器镜像仍在计划中。
选择您的文档
指定它需要了解的文件夹。文件夹之外的内容不会被读取,您随时可以收回某个文件夹。
自然地提问
用日常语言,就像询问一位读过所有资料并全部记得的同事那样。
获得附本地出处的回答
每个出自您文档的回答都会注明背后的文件和页码,方便您自己核实。
每一个有用的 AI 工具都要求您先上传
这种做法太普遍了,已经不再被当作一个决定。您需要在一份合同、一组案件笔记或一位客户的财务记录上获得帮助,于是附上文件,而它就被发往不属于您的基础设施,适用您没有谈判过的条款,进入您看不到的日志。
对大多数人来说,大多数时候这是一笔可以接受的交换。但对于您在职业上有义务保护的文件,这可能是一笔您根本不被允许做的交换。而以往的替代办法,通常就是放弃这份帮助。
也可以让模型来到文档身边。
大模型,不必配一屋子的 GPU。
经过验证的配置档不必依赖 GPU 机房。
大多数大模型基础设施把海量权重放在加速器内存中。这样速度极快,但也需要昂贵的硬件。
Mixture-of-Experts 模型提供了另一条路。每生成一个 token,只有一部分专门化的专家参与,因此一个了解硬件的运行时可以让常用组件常驻内存,其余部分在被调用时从本地 NVMe 存储流式加载。
传统部署
- 全部模型权重驻留内存
- 多块数据中心 GPU
- 大量加速器内存需求
- 云端或专用服务器集群
AI Stays Local 架构
- 模型存储在本地
- 专家路由器逐 token 选择
- 只启用选中的专家
- RAM 与本地计算
- 从 NVMe 流式加载专家
- GPU 加速可选
- GPU 集群并非必需
- 云端推理并非必需
这是一种务实的取舍:在本地掌控的同时用上大得多的模型,而不必让所有参数同时放进 GPU 内存。
硬件要求和速度取决于模型。更大的系统可能需要大量 RAM 和高速 NVMe 存储,极大规模的模型可能比云端推理更慢。
模型是一个只需下载一次的文件
让人意外的是它有多普通。模型是一个大文件:几个 GB,有时更大。它就在您的磁盘上。您提问时,电脑进行把问题变成答案的运算,就像它为电子表格做运算一样。没有任何东西是租来的,也不按用量计费。
代价是能力。小到能装进笔记本电脑的模型,并不是世界上最大的模型,在真正困难的推理上会输给它。它赢得的是其余的一切:您的文档留在原处,在飞机上也能用,也没有人按问题向您收费。
关闭某个文件夹,就会从这台机器上删除它的索引。
授权文件夹就是全部的权限模型
AI Stays Local 只读取您授权的内容,别的一概不读。授权一个文件夹,就会在您的电脑上为它建立索引,也就是让文件夹可被检索的词语索引。收回授权,这个索引就会被删除。
没有保存您文件的账户,因为根本不存在保存您文件的账户。Privacy Centre 被设计为唯一的那个界面,一眼就能看出哪些内容可读、哪些已建索引,以及是否有任何内容被允许外发。
会展示出处的回答
当回答来自您的文档时,会附上所用的文件名和段落。这不是装饰。语言模型会自信地犯错,对于肩负职业责任的人来说,唯一实际的防线就是能点进那个段落,亲自读一遍。
您
我需要提前多久通知 Kaplan & Ruiz?和 Nordwind 协议有区别吗?
AI Stays Local
Nordwind 是三十天,Kaplan & Ruiz 是六十天。两者都从书面通知之日起算,而且 Nordwind 条款要求以书面形式寄送到注册地址,而不是通过电子邮件。
两份协议都不允许在第一年内无故解约。
由一台机器完成工作
工作在您掌控的一台机器上完成,因为处理器、内存和文档本来就在那里。之后的计划不是把您的数据分散到更多设备上,而是让您已经信任的设备能够访问保存数据的那一台机器。
桌面
带引导的桌面应用。仍在计划中,尚未构建;目前通过命令行和本地 API 使用运行时。
计划中您的其他电脑
通过您自己的网络访问保存文档的那台机器。
计划中手机和平板
一条回到您自己机器的私有连接,而不是数据的第二份副本。
计划中