로컬 모델의 모델 별 추론 최적화 엔진 경쟁이 시작되었습니다
Blog version of a 2026-05-10 LinkedIn note — same claims, cleaned structure for reading.
This is the long-form blog cut of a note I originally posted on LinkedIn. The claims, numbers, and product names are the same; the formatting is for reading on the site.
Context
Original framing (translated in place for key technical posts; substance preserved):
github repo: https://lnkd.in/gdjRA5my
Redis 창시자인 Antirez 가 이틀 전 ds4 를 공개했습니다. 보통 “로컬 장비에서 최상급 AI 사용은 무리”라는 게 상식이었어요. 하지만 C 파일 몇 개로 그 상식이 깨졌습니다.
무려 DeepSeek V4 Flash 가 128GB MacBook 한 대에서 1M 컨텍스트 윈도우와 완전한 코딩 에이전트 루프를 지원하면서 돌아갑니다.
핵심 기술 3가지와 실제 성능을 정리했습니다.
① 비대칭 2-bit 양자화를 씁니다
MoE 구조에서 Expert 레이어가 전체 용량의 90%를 차지합니다. ds4 는 이 부분만 2-bit 로 압축하고 핵심 경로는 풀 정밀도로 유지해요. Antirez 가 직접 테스트한 결과 코딩 에이전트가 도구를 안정적으로 호출했습니다.
② KV Cache 를 SSD 로 옮깁니다
DualPath arxiv url: https://lnkd.in/gDqTv6AU
HBM 은 용량이
github repo: https://lnkd.in/gdjRA5my
Redis 창시자인 Antirez 가 이틀 전 ds4 를 공개했습니다. 보통 “로컬 장비에서 최상급 AI 사용은 무리”라는 게 상식이었어요. 하지만 C 파일 몇 개로 그 상식이 깨졌습니다.
무려 DeepSeek V4 Flash 가 128GB MacBook 한 대에서 1M 컨텍스트 윈도우와 완전한 코딩 에이전트 루프를 지원하면서 돌아갑니다.
핵심 기술 3가지와 실제 성능을 정리했습니다.
① 비대칭 2-bit 양자화를 씁니다
MoE 구조에서 Expert 레이어가 전체 용량의 90%를 차지합니다. ds4 는 이 부분만 2-bit 로 압축하고 핵심 경로는 풀 정밀도로 유지해요. Antirez 가 직접 테스트한 결과 코딩 에이전트가 도구를 안정적으로 호출했습니다.
② KV Cache 를 SSD 로 옮깁니다
DualPath arxiv url: https://lnkd.in/gDqTv6AU
HBM 은 용량이 부족하고 DRAM 은 비용 대비 효율이 낮습니다. 무엇보다 두 반도체 모두 공급이 극도로 제한적이에요. 남은 선택지는 SSD 뿐입니다.
지난 2월 DeepSeek 의 DualPath 연구가 이걸 데이터 센터 규모에서 이미 증명했어요. Prefill 과 Decode 를 분리하고 RDMA 로 KV Cache 를 전달하면 NIC 포화(네트워크 병목) 없이 추론 처리량이 최대 2배 올라갑니다.
캐시 히트 비용이 거의 0에 수렴하고 DeepSeek 의 실제 캐시 히트율은 95% 이상입니다. ds4 는 이 원리를 Apple Silicon 로컬 디바이스에 그대로 구현한 겁니다. 솔직히 이게 제일 기발한 선택이에요.
③ Metal 네이티브 최적화가 핵심이에요
llama.cpp 같은 범용 프레임워크는 쓰지 않습니다. Apple Silicon 전용으로 처음부터 다시 짰어요. 불필요한 오버헤드가 없으니 성능이 올라가는 구조입니다. DeepSeek V4 Flash 외에는 쓸 수 없다는 뜻이기도 하고요.
④ 실제 성능은 27 tok/s입니다
일단 빠르지는 않아요. M3 Max 128GB 기준으로 27 tok/s입니다. 하지만 로컬 에이전트 루프 돌리기에는 충분한 속도입니다. API 비용과 데이터 유출 걱정이 동시에 사라집니다.
⑤ 전체 코드가 몇 천 줄 C 코드입니다
수십억 달러 GPU 클러스터 없이 단 한 명이 C 파일 몇 개로 해냈습니다. YC CEO Garry Tan 이 바로 리트윗하며 “다운로드 중… 이건 미쳤어”라고 했어요. 그 반응이 과장이 아닙니다.
⚠️ 현재 제한 사항
ds4 는 DeepSeek V4 Flash 전용 추론 엔진입니다. 그리고 현재는 128GB 이상의 RAM 과 Apple Silicon 을 지원하는 기기에서만 사용 가능해요. 또한 Antirez 본인이 범용 AI 추론 엔진인 GGML 과 llama.cpp 없이는 불가능했다고 밝혔습니다.
오픈 소스 가중치가 공개되면 전 세계 해커들이 예상 못 할 방식으로 사용 방법을 최적화합니다. 그래서 Gemma 의 MTP 처럼, 로컬 모델별 최적화 추론 엔진이 빠르게 발전하고 있습니다.
아직은 128GB MacBook 이라는 고성능 기기가 필요하지만 다음 목적지에 우리가 어떤 레벨에 있을지 이제 저도 예상이 안됩니다.
Links
订阅通讯
获取最新 AI 洞见。