365bet取款要多久-365bet体育365bet官网-365电子游戏

DeepSeek-V4:如何在本地运行

DeepSeek-V4:如何在本地运行

DeepSeek-V4 是 DeepSeek 的新开源模型,包括 DeepSeek-V4-Pro 以及 1.6T 参数(49B 激活)以及 DeepSeek-V4-Flash 以及 284B 参数(13B 激活)。这些模型在编程、智能体工作流以及带有 100万上下文 窗口的聊天方面表现出色。在本指南中,我们将展示如何在本地运行 DeepSeek-V4-Flash : DeepSeek-V4-Flash GGUF

对于 无损 DeepSeek,请使用 Q8(UD-Q8_K_XL),它只比 大 7GB 比 Q4(UD-Q4_K_XL)。 无损 8 位 GGUF 为 162 GB 而 3 位为 103GB 这可以在一台 110GB 内存 设备上运行. DeepSeek-V4-Flash 在 MMLU-Pro 上得分 86.2%,在 GPQA Diamond 上得分 88.1%,在 Terminal Bench 2.0 上得分 56.9%。

7 月 7 日: DeepSeek-V4 现在已经可以运行了!我们还改进了 DeepSeek-V4 聊天 jinja 模板,并测试了 4000 多段对话,结果与官方基线一致。

使用指南运行教程

🦙 llama.cpp DeepSeek V4 实现修复llama.cpp 在 24162 - 我们注意到,当使用来自 任何提供方的任何 GGUF 时,在使用 KV 缓存量化时,多轮对话与 DS4 的 Hugging Face 基线相比表现不佳 --cache-type k/v q8_0 - 此问题已于 2026 年 7 月 7 日在 llama.cpp 中修复并合并,使用 25202

具体来说,在修复之前,调用 DeepSeek 量化模型会导致 overlayotin kinetic academyléléléléulif ,而在 PR 之后,"法国的首都是巴黎。",这是正确的。

引擎分数计算工具选择并行工具多轮工具嵌套工具官方代码

15/15

3

3

3

3

3

任意提供方

4/15

1

2

0

0

1

之后 25202

15/15

3

2

3

3

3

💬 DeepSeek V4 聊天模板改进我们还改进了 DeepSeek-V4 聊天 jinja 模板,并测试了 4000 多段对话,结果与黄金基线(官方 DS4)一致

我们添加了 reasoning_effort ,并且你可以选择 max、high ,就像官方 DeepSeek-V4 一样。我们按照 DS4 添加了正确的系统提示,并遵循了 gpt-oss 的风格。

而对于工具调用, reasoning_content 在 DS4 中被保留,但 jinja 聊天模板会将其排除。我们把它加回来了。

禁用思考,调整推理强度

DeepSeek-V4 默认使用推理。它也支持推理强度,其中 reasoning_effort 可以是“high”、“max”或禁用。

要禁用思考,请使用 --chat-template-kwargs '{"enable_thinking":false}'。如果你使用的是 Windows PowerShell,请使用: --chat-template-kwargs "{\"enable_thinking\":false}"

你也可以使用 --reasoning on 或 --reasoning off 现在也可以在 llama.cpp 中使用!

如需自定义推理强度或禁用推理,请使用以下示例:

📊 量化分析我们的 UD-Q8_K_XL 量化是完全无损的。DeepSeek-V4-Flash 是 量化感知训练的:官方检查点将其路由专家(模型的 96%)原生存储为 MXFP4,其余部分存储为 FP8 或 BF16。GGUF 的 MXFP4 正是这种格式,因此我们将专家按位重新打包,而 FP8 会无舍入地反量化为 BF16。我们将每个张量都与官方 DeepSeek 权重进行了比对:1,328 个全部按位一致,并且在推理时仍然保持无损(KL 散度约为 0,100% 顶部 token 一致)。

非Unsloth DeepSeek-V4-Flash GGUF 是在未使用这些路径的情况下转换的,因此与官方权重有所偏离。 UD-Q4_K_XL 保留了相同的按位精确专家,只将非专家张量(模型的 4%)量化到 Q8_0,因此在大小和质量上都与 Q8 非常接近。

与官方权重相比,这两种 Unsloth 量化都处在质量/大小前沿。UD-Q8_K_XL 是唯一的无损点。UD-Q4_K_XL 与其他社区 MXFP4 格式一致,并且比 Q4_K-experts 转换更准确,后者虽然更大,但 KLD 达到 0.029。

按层拆分的误差显示了原因。保留原生 MXFP4 专家意味着每一层的权重误差都是 0%。将专家重新量化为 Q4_K 或 IQ2_XXS 的转换会对几乎每个权重进行舍入:Q4_K 为 5%,IQ2_XXS 超过 30%。

我们的 MXFP4 在全部 840 万个权重上都是完全零误差,而 Q4_K 采用的是另一种 4 位网格,必须对每一个权重进行舍入(RMSE 5.2%)。我们还发现,对某些张量使用 Q8_0 和 F16 并非无损,而且由于 DeepSeek 已应用 QAT 来让 MXFP4 / FP8 良好工作,情况会更糟,所以我们不得不直接将它们保留为 BF16。因此,请使用 UD-Q8_K_XL 作为真正的无损量化,而 UD-Q4_K_XL 会将部分 BF16 项下转为 Q8_0。

关于以下内容的完整基准表: GGUF 基准,请看这里.

⚙️ 使用指南DeepSeek-V4-Flash 比 DeepSeek-V4-Pro 更小更快,具有 284B 参数(13B 激活),以及 100万上下文窗口。该模型有 3 种模式, 非思考, 思考 高 和 思考 最大.

建议使用 UD-IQ3_XXS 它是 103GB 以获得最佳结果。由于文件大小不包括 KV 缓存和上下文分配,请尽量至少有 110GB 内存 来运行模型。

该 UD-Q8_K_XL 量化是 DeepSeek-V4-Flash 的完整原始精度版本。其大小为 162GB,最好至少有 169GB 可用的 RAM/VRAM。

表:推理硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)

1 位2 位3 位4 位(接近无损)Q8_K_XL(无损)92 GB

102 GB

110-135 GB

162 GB

169 GB

为获得最佳性能,请确保包括 VRAM 和系统 RAM 在内的总可用内存,能比量化后的模型文件大小大出充足的余量。

推荐设置DeepSeek 为获得最佳性能推荐以下参数: temperature=1.0, top-p=1.0

思考高 默认开启。 如果已禁用,你可以通过以下方式启用: --chat-template-kwargs '{"enable_thinking":true}' 或者通过以下界面下拉菜单切换: Unsloth Studio。另请参见 DeepSeek-V4

temperature = 1.0

top-p = 1.0

最大上下文窗口: 1,048,576

对于思考最大,请将上下文至少设置为 384K 令牌.

运行 DeepSeek-V4-Flash 教程:本教程我们将使用 3 位量化 UD-IQ3_XXS,因为它可以装在 128GB RAM 设备上。将 UD-IQ3_XXS 以及 UD-Q8_K_XL (原始质量)或其他量化版本替换掉它,如果你的机器有足够内存。现在你可以在 Unsloth Studio.

🦥 Unsloth Studio 指南🦙 Llama.cpp 指南

🦥 Unsloth Studio 指南DeepSeek-V4-Flash 现在可以在 Unsloth Studio,我们的新本地 AI 开源网页界面。Unsloth Studio 可让你在 MacOS, Windows、Linux 以及:

搜索、下载, 运行 GGUF 以及 safetensor 模型

自修复 工具调用 + 网页搜索

代码执行 (Python、Bash)

自动推理 参数调优(temp、top-p 等)

通过 llama.cpp 实现快速 CPU + GPU 推理

训练 LLM 速度提升 2 倍,VRAM 减少 70%

1安装 Unsloth请确保使用最新版本。在终端中运行:

MacOS、Linux、WSL:

Windows PowerShell:

2启动 UnslothMacOS、Linux、WSL 和 Windows:

然后打开 http://127.0.0.1:8888 (或你的具体 URL)在浏览器中。

3搜索并下载 DeepSeek-V4-Flash首次启动时,你需要创建一个密码来保护你的账户,并重新登录。然后前往 Unsloth Chat 标签页,在搜索栏中搜索 DeepSeek-V4-Flash,并下载你想要的模型和量化版本。

4运行 DeepSeek-V4-Flash在使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。由于 思考高 默认开启,你可以到右侧下拉菜单将其切换为非思考或思考最大。你也可以编辑上下文长度、聊天模板和其他设置。

更多信息,你可以查看我们的 Unsloth Studio 推理指南.

🦙 Llama.cpp 指南1获取最新的 llama.cpp 在 GitHub 这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 更改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后像往常一样继续——Metal 支持默认开启。

2你现在可以使用 llama.cpp 直接加载和下载模型,就像 ollama run。首先,选择你想要的量化类型,例如 IQ3_XXS。同时使用 export LLAMA_CACHE="folder" 以强制 llama.cpp 保存到特定位置。请注意,此下载过程可能非常慢,因此最好使用下一节中的手动下载流程。

3如果你想手动下载模型,我们可以在安装 pip install huggingface_hub之后通过下面的代码下载模型。如果下载卡住,请参见: Hugging Face Hub,XET 调试

4你可以编辑 --threads 32 来设置 CPU 线程数, --ctx-size 32768 来设置上下文长度, --n-gpu-layers 2 来指定 GPU 卸载多少层。如果你的 GPU 内存不足,请尝试调整它。如果你只有 CPU 推理,也请将其移除。

📊 基准测试GGUF 基准下面是一个表格,用于比较 Unsloth 和其他提供方的量化结果。参考 = 官方权重。在 4x B200 上,以 ctx 512 对 wikitext-2 计算困惑度和 KL 散度。

量化大小(GB)PPL平均 KLDRMS delta-p相同 top token按位完全一致的权重官方(参考)

156.4

4.5319

0

0%

100%

100%

Unsloth UD-Q8_K_XL

161.9

4.5319

约 0(无损)

0.000%

100.000%

100.000%

Unsloth UD-Q4_K_XL

155.1

4.5335

0.0102

3.40%

96.28%

97.46%

bartowski MXFP4

156.0

4.5351

0.0105

3.42%

96.18%

97.57%

antirez Q4KExperts-F16(imatrix)

164.6

4.5743

0.0291

5.87%

93.95%

0.51%

antirez Q4KExperts-F16

164.6

4.5726

0.0290

5.89%

93.94%

0.93%

antirez 混合 L37-42-Q4K(imatrix)

97.6

5.8169

0.3605

21.15%

79.74%

0.41%

antirez IQ2XXS(imatrix)

86.7

6.0808

0.4079

22.23%

78.15%

0.39%

antirez IQ2XXS

86.7

6.1518

0.4207

22.74%

77.92%

0.47%

官方基准更下方可查看表格形式的基准结果:

基准(指标)V4-Flash 非思考V4-Flash 高V4-Flash 最大V4-Pro 非思考V4-Pro 高V4-Pro 最大知识与推理

MMLU-Pro(EM)

83.0

86.4

86.2

82.9

87.1

87.5

SimpleQA-Verified(Pass@1)

23.1

28.9

34.1

45.0

46.2

57.9

Chinese-SimpleQA(Pass@1)

71.5

73.2

78.9

75.8

77.7

84.4

GPQA Diamond(Pass@1)

71.2

87.4

88.1

72.9

89.1

90.1

HLE(Pass@1)

8.1

29.4

34.8

7.7

34.5

37.7

LiveCodeBench(Pass@1)

55.2

88.4

91.6

56.8

89.8

93.5

Codeforces(评级)

-

2816

3052

-

2919

3206

HMMT 2026 2 月(Pass@1)

40.8

91.9

94.8

31.7

94.0

95.2

IMOAnswerBench(Pass@1)

41.9

85.1

88.4

35.3

88.0

89.8

Apex(Pass@1)

1.0

19.1

33.0

0.4

27.4

38.3

Apex 候选榜(Pass@1)

9.3

72.1

85.7

9.2

85.5

90.2

长上下文

MRCR 1M(MMR)

37.5

76.9

78.7

44.7

83.3

83.5

CorpusQA 1M(ACC)

15.5

59.3

60.5

35.6

56.5

62.0

智能体

Terminal Bench 2.0(Acc)

49.1

56.6

56.9

59.1

63.3

67.9

SWE Verified(已解决)

73.7

78.6

79.0

73.6

79.4

80.6

SWE Pro(已解决)

49.1

52.3

52.6

52.1

54.4

55.4

SWE Multilingual(已解决)

69.7

70.2

73.3

69.8

74.1

76.2

BrowseComp(Pass@1)

-

53.5

73.2

-

80.4

83.4

带工具的 HLE(Pass@1)

-

40.3

45.1

-

44.7

48.2

MCPAtlas(Pass@1)

64.0

67.4

69.0

69.4

74.2

73.6

GDPval-AA(Elo)

-

-

1395

-

-

1554

Toolathlon(Pass@1)

40.7

43.5

47.8

46.3

49.0

51.8