deepseek算法

Searching…

zhuanlan.zhihu.com

详解DeepSeek-R1核心强化学习算法:GRPO - 知乎

算法:算法处理数据和奖励信号以确定梯度系数,从而更新模型参数。 根据方程5,在一定程度上,所有方法现在都完全信任奖励函数的信号来增加或减少某个token的条件概率。 然而,无法确保奖励信号始终可靠,特别是在极其复杂的任务中。

www.deepseek.com

DeepSeek | 深度求索

深度求索(DeepSeek),成立于2023年,专注于研究世界领先的通用人工智能底层模型与技术,挑战人工智能前沿性难题。

www.talktop.cn

DeepSeek实现原理,如何用算法突破算力瓶颈

本文深度解析DeepSeek实现原理,从混合专家架构(MoE)、多头潜在注意力(MLA)到FP8混合精度训练展现DeepSeek如何通过算法创新降低90%计算成本,推动大模型高效落地。

arxiv.org

[2412.19437] DeepSeek-V3 Technical Report - arXiv.org

Dec 27, 2024 · To achieve efficient inference and cost-effective training, DeepSeek-V3 adopts Multi-head Latent Attention (MLA) and DeepSeekMoE architectures, which were thoroughly validated in DeepSeek-V2.

cloud.tencent.com

Video — click to view

Feb 7, 2025 · DeepSeek通过知识蒸馏技术,让小模型从大模型中学习推理能力,从而在保持较低计算成本的同时,提升小模型的推理性能。

zhuanlan.zhihu.com

研读:DeepSeek-V3论文核心创新点以及和R1关系讨论 - 知乎

Feb 3, 2025 · 核心思路:在DeepSeek-V2的基础上,通过引入新的架构(Transformer模块 (MLA + DeepSeekMoE))和训练策略,进一步提升模型的性能(预训练阶段使用无辅助损失的负载均衡策略,多Token预测,文本长度扩展,后训练阶段从 DeepSeek-R1 中监督微调以加强推理,基于规则的强化 ...

news.qq.com

漫谈DeepSeek及其背后的核心技术_腾讯新闻

Feb 7, 2025 · 阿里妹导读本文深入探讨了DeepSeek大模型的核心技术,从公司背景、模型能力、训推成本到核心技术细节进行了全面分析。一、关于DeepSeek公司及其大 ...