模型卡 ↗

Model Card · Data Dashboard · 2026-09-10

DeepSeek-V4.1-Flash 数据档案

官方模型卡记录的架构规格、KV 缓存压缩与三组基准评测(基座 / 指令 / 智能体脚手架),整理为可对比、可核对的图表。所有数字均取自模型卡原文,图表为按原值重绘。

来源:Hugging Face · deepseek-ai/DeepSeek-V4.1-Flash · MIT 许可 · 557 赞 · 18 讨论 · 510.3 GB 权重(48 个分片)

KV 缓存 / Token

890B

较 V4-Flash ↓3.9× · 较 V1 ↓437×

上下文窗口

1Mtokens

原生支持图像 + 文本输入

骨干 / 激活参数

552B总参

每 Token 激活 8B(预填充)· 16B(解码)

Terminal-Bench 2.1

90.6Pass@1

对照表中最高(Opus-5.0 89.1)

Codeforces

3471Rating

仅 DeepSeek 三代参评 · 较 V4-Flash +182

01 · KV Cache

把 1M 上下文的 KV 缓存压到 890 B / Token

模型卡标题即为「Pushing the Limits of KV Cache Compression」:全局 KV 缓存在四代之间从 389,120 B/Token 降到 890 B/Token。

DeepSeek-V12023.11 389,120 B / token基准 · 1M Tokens ≈ 389 GB
DeepSeek-V3.22025.12 48,068 B / token较 V1 ↓8.1× · 1M Tokens ≈ 48.1 GB
DeepSeek-V4-Flash2026.04 3,514 B / token较 V3.2 ↓13.7× · 1M Tokens ≈ 3.51 GB
DeepSeek-V4.1-Flash2026.09 890 B / token较 V4-Flash ↓3.9× · 1M Tokens ≈ 890 MB

数值与下降倍数转录自官方图 1(b);横轴为对数刻度(100 B – 1 MB)。「1M Tokens ≈」为按每 Token 字节数换算的示意值。

890B / token

V4.1-Flash 的全局 KV 缓存;约为 V4-Flash 的 1/4,约为 V1 的 1/437。

FP4 主 KV 缓存

E2M1 格式存储,每 16 个通道共享一个 E4M3 缩放系数。

SWA Bounded Replay

只回放最近 n_win 个 Token 即可重建缺失的 SWA KV 状态,无需把 SWA KV 落盘 SSD;持久化 KV 约为 V4-Flash 的 1/8。

Compressed Sparse Attention 2

每个注意力层取 Full / Reindex / Reuse 三种静态模式之一,跨层共享主 KV 与索引器 K,并复用 Top-K 稀疏注意力索引。

02 · Architecture

因果编码器-解码器 + 稀疏注意力

解码器的全局 KV 缓存由编码器末端隐状态投影而来,使 552B 骨干每 Token 只激活 8B(预填充)/ 16B(解码)。

架构
整体结构CED 因果编码器-解码器 · 40 层 = 20 编码 + 20 解码
注意力CSA2(Full / Reindex / Reuse 三种静态模式)+ 分层稀疏索引器
KV 缓存FP4 · E2M1(每 16 通道一个 E4M3 缩放)
MoE 专家每层 1 共享专家 + 384 路由专家 · 每 Token 激活 6 个路由专家
条件记忆Engram · 196B 参数(基于 Token 查找的稀疏访问)
投机解码DSpark(半自回归草稿 + 置信度调度的验证)
视觉编码DeepSeek-ViT · 2D-RoPE · 3×3 Pixel-Unshuffle + 两层 MLP 投影
残差混合Single-Pass mHC(Mega-mHC 内核)
训练与调控
预训练45T Tokens 多模态语料 · 从零训练
稀疏注意力训练长度64K
上下文扩展在 34T Tokens 处扩展至 1M
后训练SFT → RL → 同策略蒸馏(OPD)
推理强度1–100 连续可调(推理成本 ↔ 准确率)

参数激活比例

Activation
骨干参数 552B
预填充激活 8B · 1.4%
解码激活 16B · 2.9%

条形为线性比例;百分比为激活参数 / 552B 骨干的推算值。

配套设计:Engram 条件记忆提供 196B 参数容量,但按 Token 查找稀疏访问,不进入每 Token 激活预算。

03 · Benchmarks

前沿对比:谁领先,领先多少

全部为最大推理强度(reasoning_effort=100)结果;条形长度按每张图内最大值归一化,数值与官方表格一致。

Terminal-Bench 2.1 / 3.0 与 DeepSWE v1.1 使用 DeepSeek Harness Minimal 模式(DeepSWE 采用 mini-SWE 脚手架);所有智能体评测 1M 上下文、max_steps=500,TB 2.1 无网络访问。CyberGym 无 Opus-5.0 数据,图表中该行为空。

04 · Full Results

全量数据:三张官方评测表

以下表格与官方模型卡逐数一致;单元格内条块按行内最大值归一化,加粗为该行最高分。

基准 / 指标 DeepSeek-V4-Flash-Base DeepSeek-V4-Pro-Base DeepSeek-V4.1-Flash-Base

官方内部评测框架统一设置;同一行内相差 0.3 以内视为持平。多模态四项仅 V4.1-Flash-Base 参评。

05 · Usage

调用参数与仓库信息

推荐采样参数

temperature1.0
top_p0.95 或 1.0
context_window1M tokens
max_tokens≥ 256K
reasoning_effort1 – 100(连续可调)

本版本未附带 Jinja 聊天模板;官方建议使用 encoding/ 参考实现或 Rust 工具包处理提示词编码。

仓库与集成

  • encoding/ — 自包含 Python 参考实现,覆盖多轮对话、工具调用、思考模式、数值推理强度、对话中系统消息与交错图像内容。
  • deepseek-recipe — Rust 库(Python 绑定):把请求编码为 V4 / V4.1 提示或 Token ID,并把输出解析回完整或流式响应。
  • evaluation/ — DeepSWE v1.1 复现步骤(dsh-minimal 与 mini-swe-agent)及 Pier 集成补丁。
  • inference/ — 权重转换与本地推理指引;社区量化 3 个版本(llama.cpp / LM Studio / Jan / Ollama)。
  • 仓库统计 — 510.3 GB · 48 个 Safetensors 分片 · 权重合计 484.6B 参数(BF16 1.98B · F32 42.3M · F8_E4M3 204.0B · I8 278.6B)。

核对原始模型卡与技术报告

全部数据与链接均指向官方发布源;本页仅做整理与重绘。

数据抓取于 2026-09-10 · 评测数值为官方报告口径