AI Stays Local

작동 방식

내 컴퓨터에서 실제로 일어나는 일

상자와 화살표로 된 도식은 없습니다. 여러분이 마주칠 순서대로 전체를 설명합니다.

런타임과 인용이 포함된 문서 답변은 승인된 테스터가 사용할 수 있습니다. 데스크톱 앱과 컨테이너 이미지는 예정 단계이며 아직 만들어지지 않았습니다. 공개된 소요 시간은 각 벤치마크에 명시된 하드웨어에만 해당합니다.

복잡한 부분은 제품이 맡습니다

여러분은 일을 고르고, 모델과 런타임 설정은 AI Stays Local이 맡습니다.

  1. 하드웨어 점검

    프로세서, 가속기, 메모리 종류, 저장 장치 속도, 그리고 운영체제가 스스로 확보해야 하는 양.

  2. 검증된 구성 추천

    근거가 공개된 프로필 가운데 그 컴퓨터에서 잘 돌아가는 가장 성능 높은 모델 프로필을 고르고, 다운로드 전에 한계를 알립니다.

  3. 모델 확보와 설정

    배포자나 승인된 저장소에서 변경되지 않는 리비전으로 받고, 준비 완료로 표시하기 전에 검증하며, 그 컴퓨터에 맞게 런타임을 설정합니다.

  4. 로컬에서 실행

    현재는 선정된 테스터가 명령줄이나 로컬 API로 사용합니다. 데스크톱 앱과 컨테이너 이미지는 예정되어 있습니다.

  1. 문서를 고르세요

    알고 있어야 할 폴더를 지정하세요. 그 밖은 읽지 않으며, 언제든 폴더를 다시 거둬들일 수 있습니다.

  2. 자연스럽게 질문하세요

    모든 것을 읽고 모두 기억하는 동료에게 묻듯이, 평소 쓰는 말로 질문하면 됩니다.

  3. 로컬 출처가 있는 답변

    문서에서 나온 모든 답변은 그 뒤의 파일과 페이지를 밝히므로, 주장을 직접 확인할 수 있습니다.

쓸 만한 AI 도구는 모두 먼저 업로드를 요구합니다

이 방식은 너무 익숙해져서 더 이상 선택으로 느껴지지 않습니다. 계약서나 사건 메모, 고객의 재무 기록에 도움이 필요하면 파일을 첨부합니다. 그러면 파일은 여러분 소유가 아닌 인프라로, 협상하지 않은 조건 아래, 볼 수 없는 로그로 넘어갑니다.

대부분의 사람에게 대부분의 경우 그것은 괜찮은 거래입니다. 하지만 직업상 보호할 의무가 있는 문서라면, 애초에 허용되지 않는 거래일 수도 있습니다. 그리고 지금까지의 대안은 대개 도움을 포기하는 것이었습니다.

모델이 문서에게로 갈 수도 있습니다.

GPU 팜이 필요 없습니다

GPU로 가득 찬 방 없이도 큰 모델을.

검증된 프로필에는 GPU 팜이 필요 없습니다.

대형 모델 인프라 대부분은 방대한 양의 가중치를 가속기 메모리에 올려 둡니다. 그래서 속도는 매우 빠르지만, 비싼 하드웨어가 필요합니다.

Mixture-of-Experts 모델은 다른 길을 엽니다. 생성되는 각 토큰에는 전문화된 전문가 가운데 일부만 참여하므로, 하드웨어를 고려하는 런타임은 자주 쓰는 부분을 메모리에 두고 나머지는 필요할 때 로컬 NVMe 저장 장치에서 스트리밍할 수 있습니다.

기존 배포 방식

  • 모델 가중치 전체를 메모리에 유지
  • 데이터센터용 GPU 여러 개
  • 많은 가속기 메모리 필요
  • 클라우드 또는 전용 서버 클러스터

AI Stays Local 아키텍처

  • 모델을 로컬에 저장
  • 전문가 라우터가 토큰마다 선택
  • 선택된 전문가만 활성화
  • RAM과 로컬 연산
  • NVMe에서 전문가 스트리밍
  • GPU 가속은 선택 사항
  • GPU 클러스터는 필수 아님
  • 클라우드 추론은 필수 아님

이것은 현실적인 절충입니다. 모든 파라미터를 동시에 GPU 메모리에 올리지 않고도, 로컬에서 소유하면서 훨씬 큰 모델을 쓸 수 있습니다.

내 컴퓨터
대형 MoE 모델로컬 모델 저장소 · NVMe
전문가 라우터
전문가 06전문가 12전문가 19
로컬 연산CPU · GPU · 메모리
로컬에서 생성된 답변
아키텍처 그림이며 벤치마크가 아닙니다. 라우터가 토큰마다 소수의 전문가를 고르고, 나머지는 필요할 때까지 디스크에 남아 있습니다. 측정값은 벤치마크 페이지에 있습니다.

하드웨어 요구 사항과 속도는 모델에 따라 다릅니다. 큰 시스템은 많은 RAM과 빠른 NVMe 저장 장치가 필요할 수 있으며, 초대형 모델은 클라우드 추론보다 느릴 수 있습니다.

모델은 한 번 내려받는 파일입니다

사람들이 놀라는 것은 그것이 얼마나 평범한가 하는 점입니다. 모델은 큰 파일입니다. 수 기가바이트, 때로는 그 이상입니다. 디스크에 들어 있습니다. 질문하면 컴퓨터가 질문을 답으로 바꾸는 계산을 합니다. 스프레드시트의 계산을 하는 것과 같은 의미의 계산입니다. 빌리는 것도, 사용량만큼 과금되는 것도 없습니다.

그 대가는 성능입니다. 노트북에 들어갈 만큼 작은 모델은 세계에서 가장 큰 모델이 아니며, 정말 어려운 추론에서는 그 모델에 집니다. 대신 나머지를 모두 얻습니다. 문서는 제자리에 있고, 비행기 안에서도 작동하며, 질문마다 요금을 청구하는 사람도 없습니다.

모델 선택로컬
일상이 Mac에 추천빠른 답변, 초안 작성, 문서에 관한 질문. 실행 중에는 약 6 GB를 사용합니다.
숙고실행되지만 느립니다긴 문서와 신중한 추론에 강합니다. 약 18 GB가 필요하며, 이 컴퓨터는 16 GB입니다.
심층이 컴퓨터보다 많은 메모리가 필요합니다워크스테이션과 서버용. 32 GB 이상인 컴퓨터에서 사용할 수 있습니다.
파라미터 수가 아니라 여러분을 위해 무엇을 하는지로 설명한 모델. 예정된 선택 화면의 그림입니다.
Privacy Centre로컬
문서 / 고객 / 2026파일 34개 색인됨
문서 / 연구파일 212개 색인됨
문서 / 개인읽지 않음
클라우드 요청 허용

폴더를 끄면 이 컴퓨터에서 해당 색인이 삭제됩니다.

예정된 Privacy Centre의 그림: 어떤 폴더를 읽을 수 있는지, 무엇이 색인되어 있는지, 무엇이 컴퓨터 밖으로 나가는지.

폴더 허용이 권한 모델의 전부입니다

AI Stays Local은 여러분이 허용한 것만 읽고, 그 외에는 읽지 않습니다. 폴더를 허용하면 여러분의 컴퓨터에 그 폴더의 색인, 즉 폴더를 검색할 수 있게 해 주는 단어 색인이 만들어집니다. 폴더 허용을 거둬들이면 그 색인은 삭제됩니다.

파일을 보관하는 계정은 없습니다. 파일을 보관하는 계정이라는 것이 애초에 존재하지 않기 때문입니다. Privacy Centre는 무엇을 읽을 수 있는지, 무엇이 색인되어 있는지, 밖으로 나가도록 허용된 것이 있는지를 한눈에 보여 주는 단 하나의 화면으로 설계되어 있습니다.

출처를 보여 주는 답변

답변이 문서에서 나온 경우, 사용한 파일 이름과 구절이 함께 표시됩니다. 장식이 아닙니다. 언어 모델은 확신에 찬 실수를 합니다. 직업상 책임이 걸린 사람에게 현실적인 유일한 방어는, 클릭해서 그 문단으로 가서 직접 읽어 보는 것입니다.

AI Stays Local - 고객 / 2026로컬

Kaplan & Ruiz에는 얼마 전에 통지해야 하나요? Nordwind 계약과 다른가요?

AI Stays Local

Nordwind는 30일, Kaplan & Ruiz는 60일입니다. 둘 다 서면 통지 시점부터 계산하며, Nordwind 조항은 이메일이 아니라 등록된 주소로 서면 통지를 요구합니다.

두 계약 모두 첫해 안에는 임의 해지를 허용하지 않습니다.

Kaplan-Ruiz-SOW.pdf p.2Nordwind-MSA.pdf p.7, p.19
이 폴더의 문서 34건에 대해 질문하세요이 Mac에서 답변함
이 페이지를 위해 그린 채팅과 인용의 그림입니다. 빌드의 스크린숏이 아니라 디자인 스케치입니다.

일은 한 대의 컴퓨터가 합니다

일은 여러분이 관리하는 한 대의 컴퓨터에서 이루어집니다. 프로세서와 메모리와 문서가 이미 거기 있기 때문입니다. 그다음 계획은 데이터를 더 많은 기기로 흩뜨리는 것이 아니라, 이미 신뢰하는 기기들이 데이터를 가진 그 한 대에 닿을 수 있게 하는 것입니다.

  • 데스크톱

    안내형 데스크톱 애플리케이션. 예정 단계이며 아직 만들어지지 않았습니다. 현재 런타임은 명령줄과 로컬 API로 사용합니다.

    예정
  • 다른 컴퓨터

    내 네트워크를 통해 문서를 가진 컴퓨터에 접속합니다.

    예정
  • 휴대폰과 태블릿

    데이터의 두 번째 사본이 아니라, 내 컴퓨터로 돌아가는 비공개 연결.

    예정
Available through a controlled private beta. Larger model profiles are added as they complete hardware validation.