로컬 모델의 모델 별 추론 최적화 엔진 경쟁이 시작되었습니다
Blog version of a 2026-05-10 LinkedIn note — same claims, cleaned structure for reading.
This is the long-form blog cut of a note I originally posted on LinkedIn. The claims, numbers, and product names are the same; the formatting is for reading on the site.
Context
Original framing (translated in place for key technical posts; substance preserved):
github repo: https://lnkd.in/gdjRA5my
Redis 창시자인 Antirez 가 이틀 전 ds4 를 공개했습니다. 보통 “로컬 장비에서 최상급 AI 사용은 무리”라는 게 상식이었어요. 하지만 C 파일 몇 개로 그 상식이 깨졌습니다.
무려 DeepSeek V4 Flash 가 128GB MacBook 한 대에서 1M 컨텍스트 윈도우와 완전한 코딩 에이전트 루프를 지원하면서 돌아갑니다.
핵심 기술 3가지와 실제 성능을 정리했습니다.
① 비대칭 2-bit 양자화를 씁니다
MoE 구조에서 Expert 레이어가 전체 용량의 90%를 차지합니다. ds4 는 이 부분만 2-bit 로 압축하고 핵심 경로는 풀 정밀도로 유지해요. Antirez 가 직접 테스트한 결과 코딩 에이전트가 도구를 안정적으로 호출했습니다.
② KV Cache 를 SSD 로 옮깁니다
DualPath arxiv url: https://lnkd.in/gDqTv6AU
HBM 은 용량이
github repo: https://lnkd.in/gdjRA5my
Redis 창시자인 Antirez 가 이틀 전 ds4 를 공개했습니다. 보통 “로컬 장비에서 최상급 AI 사용은 무리”라는 게 상식이었어요. 하지만 C 파일 몇 개로 그 상식이 깨졌습니다.
무려 DeepSeek V4 Flash 가 128GB MacBook 한 대에서 1M 컨텍스트 윈도우와 완전한 코딩 에이전트 루프를 지원하면서 돌아갑니다.
핵심 기술 3가지와 실제 성능을 정리했습니다.
① 비대칭 2-bit 양자화를 씁니다
MoE 구조에서 Expert 레이어가 전체 용량의 90%를 차지합니다. ds4 는 이 부분만 2-bit 로 압축하고 핵심 경로는 풀 정밀도로 유지해요. Antirez 가 직접 테스트한 결과 코딩 에이전트가 도구를 안정적으로 호출했습니다.
② KV Cache 를 SSD 로 옮깁니다
DualPath arxiv url: https://lnkd.in/gDqTv6AU
HBM 은 용량이 부족하고 DRAM 은 비용 대비 효율이 낮습니다. 무엇보다 두 반도체 모두 공급이 극도로 제한적이에요. 남은 선택지는 SSD 뿐입니다.
지난 2월 DeepSeek 의 DualPath 연구가 이걸 데이터 센터 규모에서 이미 증명했어요. Prefill 과 Decode 를 분리하고 RDMA 로 KV Cache 를 전달하면 NIC 포화(네트워크 병목) 없이 추론 처리량이 최대 2배 올라갑니다.
캐시 히트 비용이 거의 0에 수렴하고 DeepSeek 의 실제 캐시 히트율은 95% 이상입니다. ds4 는 이 원리를 Apple Silicon 로컬 디바이스에 그대로 구현한 겁니다. 솔직히 이게 제일 기발한 선택이에요.
③ Metal 네이티브 최적화가 핵심이에요
llama.cpp 같은 범용 프레임워크는 쓰지 않습니다. Apple Silicon 전용으로 처음부터 다시 짰어요. 불필요한 오버헤드가 없으니 성능이 올라가는 구조입니다. DeepSeek V4 Flash 외에는 쓸 수 없다는 뜻이기도 하고요.
④ 실제 성능은 27 tok/s입니다
일단 빠르지는 않아요. M3 Max 128GB 기준으로 27 tok/s입니다. 하지만 로컬 에이전트 루프 돌리기에는 충분한 속도입니다. API 비용과 데이터 유출 걱정이 동시에 사라집니다.
⑤ 전체 코드가 몇 천 줄 C 코드입니다
수십억 달러 GPU 클러스터 없이 단 한 명이 C 파일 몇 개로 해냈습니다. YC CEO Garry Tan 이 바로 리트윗하며 “다운로드 중… 이건 미쳤어”라고 했어요. 그 반응이 과장이 아닙니다.
⚠️ 현재 제한 사항
ds4 는 DeepSeek V4 Flash 전용 추론 엔진입니다. 그리고 현재는 128GB 이상의 RAM 과 Apple Silicon 을 지원하는 기기에서만 사용 가능해요. 또한 Antirez 본인이 범용 AI 추론 엔진인 GGML 과 llama.cpp 없이는 불가능했다고 밝혔습니다.
오픈 소스 가중치가 공개되면 전 세계 해커들이 예상 못 할 방식으로 사용 방법을 최적화합니다. 그래서 Gemma 의 MTP 처럼, 로컬 모델별 최적화 추론 엔진이 빠르게 발전하고 있습니다.
아직은 128GB MacBook 이라는 고성능 기기가 필요하지만 다음 목적지에 우리가 어떤 레벨에 있을지 이제 저도 예상이 안됩니다.
Links
Assine a newsletter
Receba insights sobre a IA mais recente.