ハードウェアへの適応
メモリ、演算性能、ストレージ、アクセラレーションをマシンから読み取ります。計画は平均的なマシンではなくそのマシンのために立てられ、ハードウェアが変われば計画も変わります。
技術
理論上は収まるモデルが、実際にうまく動くとは限りません。AI Stays Local のランタイムは、実際に存在するハードウェアに合わせて計画し、記録された根拠のあるプロファイルだけを推奨し、ライフサイクル全体をあなたのマシン上で管理します。このページでは考え方を説明し、エンジン内部の手法は説明しません。
メモリ、演算性能、ストレージ、アクセラレーションをマシンから読み取ります。計画は平均的なマシンではなくそのマシンのために立てられ、ハードウェアが変われば計画も変わります。
プロファイルとは、固定したリビジョンと明示された精度の特定のオープンウェイトモデルに、評価に使ったハードウェアと評価の結果を添えたものです。ランタイムが推奨し、インストールし、実行する単位です。
使えるメモリは、総メモリから OS が確保する分を引いたものです。ユニファイドメモリ、システム RAM、独立 GPU のメモリは別々の資源として扱い、ストレージの空き容量も計画に含めます。
推論はあなたが管理するマシンで実行されます。通常のローカル推論はトークン単位で課金されず、質問には、その質問をした場所で回答します。
取得、検証、起動、ヘルスチェック、停止、削除はランタイムが担います。インストールに失敗しても、すでに動作していた検証済みモデルが置き換えられることはありません。
動作すること、検証されていること、使えること、提供されていることは別々の事実で、別々に記録します。パラメーター数を根拠として扱うことはなく、公開する数値にはすべてハードウェアと方法を明記します。
ローカル推論の間、プロンプトと文書はマシン上で処理されます。ネットワークはランタイムとモデルファイルの入手に使われ、ライセンス確認には内容が含まれず、テレメトリは既定でオフです。
モデルが役に立つかどうかは、モデル自体、その精度、使えるメモリ、利用できるアクセラレーション、読み込み元のストレージの速度、そして任される作業によって決まります。メモリの数値だけでは、ほとんど何も予測できません。
そのため、ランタイムはモデル名ではなくプロファイルを推奨します。各プロファイルには裏付けとなる根拠と観点ごとの状態があり、マシンへの推奨は、そのクラスのハードウェアを根拠がカバーしているプロファイルからのみ選ばれます。
エンジンがメモリ内でモデルデータをどう配置し移動させるかは製品の一部であり、このサイトでは説明していません。
すべてのモデルは、それぞれのライセンスのもとで公開元に帰属します。ランタイムが使用する外部のエンジン開発の成果は製品の告知文でクレジットしており、外部プロジェクトが報告した結果を私たちのものとして示すことは決してありません。AI Stays Local はその上の製品レイヤーで、ハードウェアの計画、取得、ランタイムのオーケストレーション、ライフサイクル管理、アプリケーションを担います。ランタイムはプロプライエタリであり、オープンソースとは称していません。