AI Stays Local

しくみ

あなたのコンピューターで実際に起きていること

箱と矢印の図はありません。出会う順に、全体をそのまま説明します。

ランタイムと引用付きの文書回答は、承認済みのテスターが利用できます。デスクトップアプリとコンテナイメージは予定段階で、まだ作られていません。公開している所要時間は、各ベンチマークに記載したハードウェアにのみ当てはまります。

複雑な部分は製品が引き受けます

あなたは仕事を選ぶだけ。モデルとランタイムの設定は AI Stays Local が行います。

  1. ハードウェアを調べる

    プロセッサー、アクセラレーター、メモリの種類、ストレージの速さ、OS が自分のために確保する必要がある分。

  2. 検証済みの構成を推奨する

    根拠が公開されたプロファイルの中から、そのマシンで無理なく動く最も能力の高いものを選び、ダウンロード前に制限を示します。

  3. モデルを取得して設定する

    公開元または承認済みのリポジトリから、変更されないリビジョンを取得し、準備完了とする前に検証し、そのマシン向けにランタイムを設定します。

  4. ローカルで動かす

    現在は、選ばれたテスターがコマンドラインまたはローカル API で利用できます。デスクトップアプリとコンテナイメージは予定段階です。

  1. 文書を選ぶ

    知ってほしいフォルダーを指定します。その外側は読まれず、フォルダーはいつでも取り消せます。

  2. 自然に質問する

    すべてに目を通し、すべて覚えている同僚に聞くように、普段の言葉で質問できます。

  3. ローカルの出典つきで答えを得る

    文書に基づく回答はすべて、根拠となるファイルとページを示すので、自分で確かめられます。

役に立つAIツールは、どれもまずアップロードを求めます

このやり方はあまりに当たり前になり、もはや判断だと意識されていません。契約書や事件のメモ、顧客の財務記録について助けが欲しいとき、ファイルを添付します。するとファイルは、自分のものではないインフラへ、交渉していない条件のもとで、見ることのできないログへと送られます。

多くの人にとって、多くの場合、それは妥当な取引です。しかし職業上守る義務のある文書では、そもそも許されない取引かもしれません。そしてこれまでの選択肢は、たいてい助けを諦めることでした。

モデルの方が、文書のところへ来ればいいのです。

GPU ファームは不要

GPU を並べた部屋なしで、大きなモデルを。

検証済みのプロファイルに GPU ファームは要りません。

大規模モデルのインフラの多くは、膨大な量の重みをアクセラレーターのメモリに載せています。そのため非常に速い一方で、高価なハードウェアが必要です。

Mixture-of-Experts モデルには別の道があります。生成される各トークンに関わるのは専門化されたエキスパートの一部だけなので、ハードウェアを考慮したランタイムは、よく使う部分をメモリに常駐させ、それ以外は呼ばれたときにローカルの NVMe ストレージからストリーミングできます。

従来の導入

  • モデルの重みをすべてメモリに保持
  • データセンター向け GPU を複数
  • 大量のアクセラレーターメモリが必要
  • クラウドまたは専用サーバークラスター

AI Stays Local のアーキテクチャ

  • モデルはローカルに保存
  • エキスパートルーターがトークンごとに選択
  • 選ばれたエキスパートだけが動作
  • RAM とローカルの計算
  • NVMe からのエキスパートのストリーミング
  • GPU による高速化は任意
  • GPU クラスターは必須ではない
  • クラウドでの推論は必須ではない

これは現実的なトレードオフです。すべてのパラメーターを同時に GPU メモリに載せなくても、ローカルで所有しながら、はるかに大きなモデルを使えます。

あなたのコンピューター
大きな MoE モデルローカルのモデル保存領域 · NVMe
エキスパートルーター
エキスパート 06エキスパート 12エキスパート 19
ローカルの計算CPU · GPU · メモリ
ローカルで生成した回答
アーキテクチャの図解であり、ベンチマークではありません。ルーターがトークンごとに少数のエキスパートを選び、残りは必要になるまでディスクに置かれます。実測値はベンチマークのページにあります。

必要なハードウェアと速度はモデルによって異なります。大きなシステムでは多くの RAM と高速な NVMe ストレージが必要になることがあり、極端に大規模なモデルはクラウドでの推論より遅くなる場合があります。

モデルは一度ダウンロードするファイルです

意外なのは、それがごく普通のものだということです。モデルは大きなファイルで、数ギガバイト、ときにはそれ以上あります。ディスクに置かれています。質問すると、コンピューターが質問を答えに変える計算をします。表計算ソフトの計算をするのと同じ意味での計算です。何も借りておらず、使った分だけ課金されることもありません。

代わりに手放すのは能力です。ノートパソコンに収まるほど小さなモデルは世界最大のモデルではなく、本当に難しい推論では負けます。そのかわり、それ以外のすべてを得ます。文書は動かず、機内でも使え、質問ごとに請求されることもありません。

モデルを選ぶローカル
日常お使いの Mac に推奨すばやい回答、下書き、文書についての質問に。動作中は約 6 GB を使います。
熟考動きますが、遅くなります長い文書や丁寧な推論に強いモデルです。約 18 GB 必要で、お使いのマシンは 16 GB です。
深層このマシンのメモリでは足りませんワークステーションやサーバー向け。32 GB 以上のマシンで利用できます。
パラメーター数ではなく、何をしてくれるかでモデルを説明しています。予定している選択画面のイラストです。
Privacy Centreローカル
書類 / 顧客 / 202634件のファイルをインデックス化
書類 / 調査212件のファイルをインデックス化
書類 / 個人読み取りなし
クラウドへのリクエストを許可オフ

フォルダーをオフにすると、そのインデックスがこのマシンから削除されます。

予定している Privacy Centre のイラスト。どのフォルダーが読めるか、何がインデックス化されているか、何がマシンの外に出るかを示します。

フォルダーの許可が、権限モデルのすべてです

AI Stays Local は、あなたが許可したものだけを読みます。フォルダーを許可すると、あなたのマシン上にそのフォルダーのインデックス、つまり検索を可能にする語句のインデックスが作られます。許可を取り消すと、そのインデックスは削除されます。

ファイルを預かるアカウントはありません。ファイルを預かるアカウントという仕組みが、そもそも存在しないからです。Privacy Centre は、何が読めるのか、何がインデックス化されているのか、外部に出ることが許されているものがあるのかを一目で示す、ひとつの画面として設計されています。

出典を示す回答

回答が文書に基づく場合、使ったファイル名と箇所が添えられます。これは飾りではありません。言語モデルは自信満々に間違えます。職業上の責任を負う人にとって現実的な唯一の防御は、クリックしてその段落を開き、自分で読めることです。

AI Stays Local - 顧客 / 2026ローカル

あなた

Kaplan & Ruiz にはどれくらい前に通知する必要がありますか。Nordwind との契約とは違いますか。

AI Stays Local

Nordwind は30日、Kaplan & Ruiz は60日です。どちらも書面による通知から数え、Nordwind の条項ではメールではなく登録住所への書面での通知が求められます。

どちらの契約も、最初の1年以内の任意解約を認めていません。

Kaplan-Ruiz-SOW.pdf p.2Nordwind-MSA.pdf p.7, p.19
このフォルダーの34件の文書について質問この Mac で回答
このページのために描いたチャットと引用のイラストです。ビルドのスクリーンショットではなく、デザインのスケッチです。

作業するのは1台のマシン

作業は、あなたが管理する1台のマシンで行います。プロセッサーもメモリも文書も、すでにそこにあるからです。その先の計画は、データを多くの機器に広げることではなく、すでに信頼している機器から、データを持つその1台に届くようにすることです。

  • デスクトップ

    ガイド付きのデスクトップアプリ。予定段階で、まだ作られていません。現在ランタイムはコマンドラインとローカル API で使います。

    予定
  • ほかのコンピューター

    自分のネットワーク経由で、文書を持つマシンにアクセスします。

    予定
  • スマートフォンとタブレット

    データの2つ目のコピーではなく、自分のマシンへのプライベートな接続。

    予定
Available through a controlled private beta. Larger model profiles are added as they complete hardware validation.