dopaminergic

Searching…

www.zhihu.com

如何评价 DeepSeek 的 DeepSeek-V3 模型? - 知乎

尽管DeepSeek-V3展示了per-tile和per-group量化对于模型收敛的重要性,论文中并没有给出对应的FP8矩阵乘法的算子效率。 另外,论文中缺乏per-token加per-channel量化的讨论,不清楚这种实现上更加友好的量化方法对于训练稳定性的影响会有多大。

www.zhihu.com

使用Deepseek需要付费的吗? - 知乎

2、阿里云百炼新人可领取百万token3: bailian.console.aliyun.com 此外,DeepSeek还为企业提供定制化的解决方案,这类服务通常需要根据具体需求协商价格。 所以,普通用户可以免费使用 DeepSeek Chat 的基础功能,而更高级的 API 服务和企业解决方案则需要付费。

www.zhihu.com

如何评价 DeepSeek 上新的「专家模式」? - 知乎

5 days ago · 之前DeepSeek测试的长上下文模型仅能生成2000字,Gemini3.1pro生成的有四千字,Qwem3.6Plus有五千字。 (这个太长了 就不截图了) 而且读下来,专家模式只花了十几秒生成的内容,比Qwen Chatapp里Qwen3.6Plus Deep Research模式花了十几分钟生成的报告更加清晰,详细可用。

www.zhihu.com

有必要自己将deepseek部署到本地吗? - 知乎

顺带教大家如何在10分钟内零基础地完全本地化部署DeepSeek-R1模型。 1.为什么要自己部署DeepSeek? 最近DeepSeek非常火爆! 它不仅能撰写文案和进行研究,还能联网实时回答问题,堪称智能助理界的“小钢炮”! 不过,官网常常出现以下问题: 1.高峰期排队让人 ...

www.zhihu.com

DeepSeek V4 为什么还不发布? - 知乎

DeepSeek V4 为什么还不发布? 年初已经有deepseek v4 发布的消息了,但是已经过去2个月了,还是没有看见v4的身影, qwen 已经在春节发布了新版本,确定已经不太成功了,… 显示全部 关注者 675 被浏览

www.zhihu.com

DeepSeek创始人梁文峰是个什么样的人? - 知乎

Jan 31, 2025 · 不到一年时间,2024年5月,DeepSeek发布混合专家语言模型DeepSeek - V2,12月26日,上线并开源DeepSeek - V3模型,就是我们大多数人在春节期间用的这个版本。 整个训练过程仅用不到280万个GPU小时,成本约4000万元人民币。

www.zhihu.com

deepseek的chat和reasoner功能有何区别? - 知乎

自Deepseek问世以来,深度思考模型在数学和编程任务中展现出了卓越的推理能力。 但是,在需要通过图像、动作交织轨迹与环境连续交互的embodied领域,其有效性尚未得到充分探索。 embodied场景要求模型具备空间理解、时间推理以及基于交互历史的持续自我反思能力,这与deepseek主要依赖逻辑演绎的 ...