Tony Lee
Tony Lee
Índice
2 min de lectura

Field Note: TL;DR:

Blog version of a 2026-04-24 LinkedIn note — same claims, cleaned structure for reading.

This is the long-form blog cut of a note I originally posted on LinkedIn. The claims, numbers, and product names are the same; the formatting is for reading on the site.

Context

Original framing (translated in place for key technical posts; substance preserved):

딥시크의 차세대 모델이 공개되었습니다. 세상을 놀라게 한 V3 이후 무려 1년 넘게 걸렸네요.

hf repo: https://lnkd.in/gw3QzA-j

최상위 클로즈드 모델과 견줄 만한 성능을 갖췄지만, 이번 릴리스의 의미는 성능 보다 다른 데 있습니다.

바로 KV 캐시 사용량을 90% 줄여서, 같은 GPU로 10배 많은 요청을 처리할 수 있게 설계했습니다. HBM이 부족한 시대에 아키텍처로 정면 돌파한 모델입니다.

1️⃣ 두 가지 모델이 공개됐습니다.

DeepSeek-V4-Pro (전체 파라미터 1.6T, 활성 49B) Agentic Coding 부문에서 오픈 소스 SOTA를 새로 썼습니다. 수학·STEM·코딩 벤치마크에서 Opus 4.6과 대등한 수준을 기록합니다.

DeepSeek-V4-Flash (전체 284B, 활성 13B) 비용 효율에 집중한 경량 모델입니다. 1M 컨텍스트를 저비용으로 운용할 수 있어, 대량 서빙 환경에 적합합니다.

2️⃣ 성능이 아니라

딥시크의 차세대 모델이 공개되었습니다. 세상을 놀라게 한 V3 이후 무려 1년 넘게 걸렸네요.

hf repo: https://lnkd.in/gw3QzA-j

최상위 클로즈드 모델과 견줄 만한 성능을 갖췄지만, 이번 릴리스의 의미는 성능 보다 다른 데 있습니다.

바로 KV 캐시 사용량을 90% 줄여서, 같은 GPU로 10배 많은 요청을 처리할 수 있게 설계했습니다. HBM이 부족한 시대에 아키텍처로 정면 돌파한 모델입니다.

1️⃣ 두 가지 모델이 공개됐습니다.

DeepSeek-V4-Pro (전체 파라미터 1.6T, 활성 49B) Agentic Coding 부문에서 오픈 소스 SOTA를 새로 썼습니다. 수학·STEM·코딩 벤치마크에서 Opus 4.6과 대등한 수준을 기록합니다.

DeepSeek-V4-Flash (전체 284B, 활성 13B) 비용 효율에 집중한 경량 모델입니다. 1M 컨텍스트를 저비용으로 운용할 수 있어, 대량 서빙 환경에 적합합니다.

2️⃣ 성능이 아니라 효율이 본질입니다.

V4-Pro는 1M 토큰 기준으로 V3.2 대비 추론 FLOPs 27%, KV 캐시 10%만 사용합니다. 디코드 단계에서는 연산량이 아니라 메모리가 병목입니다. 그래서 KV 캐시 절감이 곧 처리량 확보로 직결됩니다.

GB300 NVL72를 기준으로 비교하면, V3.2는 1M 컨텍스트에서 GPU 한 장당 요청 4개가 한계입니다. V4는 같은 하드웨어에서 약 40개를 소화합니다. 10배의 효율을 낼 수 있다는 뜻입니다. 참고로 V3.2 도 메모리 효율적인 모델이었으니 타사 대비 몇십 배의 효율을 만들어내고 있다고 판단할 수 있습니다.

3️⃣ “GPU를 더 사라”가 아니라 “아키텍처를 바꿔라”입니다.

tech report: https://lnkd.in/g8aSseG8

HBM 수급이 전 세계적으로 병목인 지금, 하드웨어를 늘리는 것만이 답은 아닙니다. 동일한 자원에서 서빙 처리량을 10배 끌어올렸다는 건, 인프라 비용 구조 자체를 재정의하는 수준의 기여입니다. 그리고 58 페이지 분량의 tech report 와 open source model 을 공개한 것은 차원이 다른 행동임에 분명합니다.

DeepSeek이 근본 연구소라는 말이 괜히 나오는 게 아닙니다.

Únete al boletín

Recibe insights sobre la IA más reciente.