Model Card · Data Dashboard · 2026-09-10
DeepSeek-V4.1-Flash 数据档案
官方模型卡记录的架构规格、KV 缓存压缩与三组基准评测(基座 / 指令 / 智能体脚手架),整理为可对比、可核对的图表。所有数字均取自模型卡原文,图表为按原值重绘。
KV 缓存 / Token
890B
较 V4-Flash ↓3.9× · 较 V1 ↓437×
上下文窗口
1Mtokens
原生支持图像 + 文本输入
骨干 / 激活参数
552B总参
每 Token 激活 8B(预填充)· 16B(解码)
Terminal-Bench 2.1
90.6Pass@1
对照表中最高(Opus-5.0 89.1)
Codeforces
3471Rating
仅 DeepSeek 三代参评 · 较 V4-Flash +182
01 · KV Cache
把 1M 上下文的 KV 缓存压到 890 B / Token
模型卡标题即为「Pushing the Limits of KV Cache Compression」:全局 KV 缓存在四代之间从 389,120 B/Token 降到 890 B/Token。
数值与下降倍数转录自官方图 1(b);横轴为对数刻度(100 B – 1 MB)。「1M Tokens ≈」为按每 Token 字节数换算的示意值。
V4.1-Flash 的全局 KV 缓存;约为 V4-Flash 的 1/4,约为 V1 的 1/437。
FP4 主 KV 缓存
E2M1 格式存储,每 16 个通道共享一个 E4M3 缩放系数。
SWA Bounded Replay
只回放最近 n_win 个 Token 即可重建缺失的 SWA KV 状态,无需把 SWA KV 落盘 SSD;持久化 KV 约为 V4-Flash 的 1/8。
Compressed Sparse Attention 2
每个注意力层取 Full / Reindex / Reuse 三种静态模式之一,跨层共享主 KV 与索引器 K,并复用 Top-K 稀疏注意力索引。
02 · Architecture
因果编码器-解码器 + 稀疏注意力
解码器的全局 KV 缓存由编码器末端隐状态投影而来,使 552B 骨干每 Token 只激活 8B(预填充)/ 16B(解码)。
| 架构 | |
| 整体结构 | CED 因果编码器-解码器 · 40 层 = 20 编码 + 20 解码 |
| 注意力 | CSA2(Full / Reindex / Reuse 三种静态模式)+ 分层稀疏索引器 |
| KV 缓存 | FP4 · E2M1(每 16 通道一个 E4M3 缩放) |
| MoE 专家 | 每层 1 共享专家 + 384 路由专家 · 每 Token 激活 6 个路由专家 |
| 条件记忆 | Engram · 196B 参数(基于 Token 查找的稀疏访问) |
| 投机解码 | DSpark(半自回归草稿 + 置信度调度的验证) |
| 视觉编码 | DeepSeek-ViT · 2D-RoPE · 3×3 Pixel-Unshuffle + 两层 MLP 投影 |
| 残差混合 | Single-Pass mHC(Mega-mHC 内核) |
| 训练与调控 | |
| 预训练 | 45T Tokens 多模态语料 · 从零训练 |
| 稀疏注意力训练长度 | 64K |
| 上下文扩展 | 在 34T Tokens 处扩展至 1M |
| 后训练 | SFT → RL → 同策略蒸馏(OPD) |
| 推理强度 | 1–100 连续可调(推理成本 ↔ 准确率) |
参数激活比例
Activation条形为线性比例;百分比为激活参数 / 552B 骨干的推算值。
03 · Benchmarks
前沿对比:谁领先,领先多少
全部为最大推理强度(reasoning_effort=100)结果;条形长度按每张图内最大值归一化,数值与官方表格一致。
Terminal-Bench 2.1 / 3.0 与 DeepSWE v1.1 使用 DeepSeek Harness Minimal 模式(DeepSWE 采用 mini-SWE 脚手架);所有智能体评测 1M 上下文、max_steps=500,TB 2.1 无网络访问。CyberGym 无 Opus-5.0 数据,图表中该行为空。
04 · Full Results
全量数据:三张官方评测表
以下表格与官方模型卡逐数一致;单元格内条块按行内最大值归一化,加粗为该行最高分。
| 基准 / 指标 | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base | DeepSeek-V4.1-Flash-Base |
|---|
官方内部评测框架统一设置;同一行内相差 0.3 以内视为持平。多模态四项仅 V4.1-Flash-Base 参评。
| 基准 / 指标 | Opus-5.0 | GPT-5.6 Sol | K3 | GLM-5.3 | DS-V4-Pro | DS-V4-Flash | DS-V4.1-Flash |
|---|
全部为 reasoning_effort=100、temperature=1.0、top_p=0.95。† 为 HLE 纯文本子集:GLM-5.3 42.0、DS-V4-Pro 42.7、DS-V4-Flash 37.8;DS-V4.1-Flash 完整 HLE 为 36.8、纯文本子集为 39.1。视觉类基准(Chartography / BabyVision / ZeroBench)使用 Claude Code 脚手架与 512K 上下文。
同一模型(DeepSeek-V4.1-Flash,最大推理强度)在 8 种智能体脚手架下的成绩:DeepSWE v1.1 每任务 N=8 样本,Terminal-Bench 2.1 为 N=3;Linux 容器、1M 上下文、max_steps=500,TB 2.1 无网络访问。
05 · Usage
调用参数与仓库信息
推荐采样参数
| temperature | 1.0 |
| top_p | 0.95 或 1.0 |
| context_window | 1M tokens |
| max_tokens | ≥ 256K |
| reasoning_effort | 1 – 100(连续可调) |
本版本未附带 Jinja 聊天模板;官方建议使用 encoding/ 参考实现或 Rust 工具包处理提示词编码。
仓库与集成
- encoding/ — 自包含 Python 参考实现,覆盖多轮对话、工具调用、思考模式、数值推理强度、对话中系统消息与交错图像内容。
- deepseek-recipe — Rust 库(Python 绑定):把请求编码为 V4 / V4.1 提示或 Token ID,并把输出解析回完整或流式响应。
- evaluation/ — DeepSWE v1.1 复现步骤(dsh-minimal 与 mini-swe-agent)及 Pier 集成补丁。
- inference/ — 权重转换与本地推理指引;社区量化 3 个版本(llama.cpp / LM Studio / Jan / Ollama)。
- 仓库统计 — 510.3 GB · 48 个 Safetensors 分片 · 权重合计 484.6B 参数(BF16 1.98B · F32 42.3M · F8_E4M3 204.0B · I8 278.6B)。