模型v3和v2.5

Searching…

zhuanlan.zhihu.com

DeepSeek V3到V3.2的进化之路,一文看全

与 DeepSeek V3 的发布策略如出一辙,DeepSeek 团队再次选择在一个美国主要节假日周末发布了他们的新旗舰模型。 鉴于 DeepSeek V3.2 展现出了极佳的性能水平(在基准测试中对标 GPT-5 和 Gemini 3.0 Pro),加之它本身也是一个开放权重模型,这无疑值得重点关注。

developer.baidu.com

DeepSeek系列模型对比:R1/V3/VL/V2/R1-Zero技术解析与选型指南

DeepSeek系列作为新一代多模态AI模型,其不同版本在技术架构、性能表现和应用场景上存在显著差异。 本文将从技术参数、功能特性、适用场景三个维度,系统对比DeepSeek-R1、DeepSeek-V3、DeepSeek-VL、DeepSeek-V2、DeepSeek-R1-Zero五 大模型,为 开发者 提供技术选型参考。

syhya.github.io

DeepSeek-V2 vs V3 | Yue Shui 博客 - syhya.github.io

DeepSeek-V2 在 8.1T tokens 上进行预训练,而 DeepSeek-V3 则在更大规模的 14.8T tokens 上训练。两者都经过了监督微调(Supervised Fine-Tuning, SFT)和强化学习(Reinforcement Learning, RL)阶段以充分释放潜力。评估结果显示,DeepSeek-V2 和 V3 在众多基准测试中均达到了开源模型的顶尖水平,DeepSeek-V3 更是成为了目前最 ...

cloud.tencent.com

Video — click to view

DeepSeek-V3:采用了多头潜在注意力(MLA)和DeepSeekMoE架构,引入了无辅助损失的 负载均衡 策略和多标记预测训练目标,进一步优化了模型性能。 DeepSeek-V2:采用混合专家(MoE)架构,通过细粒度的专家分配和共享专家机制实现经济高效的训练。 推理速度与性能:

www.sohu.com

解密DeepSeek模型:V2、V3与R1训练方法全面解析 - 搜狐

在当今快速发展的人工智能领域,模型的性能直接影响到各种实际应用的效果。DeepSeek系列,包括最新的DeepSeekV2、V3及R1,各自具有独特的训练方法和技术特性,这不仅提升了模型的语言理解能力,也极大地优化了计算效率 ...