AI 深度解读 · 科技 · 人工智能
DeepSeek又发重磅更新
30 秒速读赶时间看这里
DeepSeek V4-Flash正式版参数未变,代码与智能体能力跃升。
热点原文摘录
"近日,DeepSeek低调地挂出一则通知:V4-Flash正式版(或V4-Flash-0731)上线公测。随后,开发者社区出现一个反常的事实——V4-Flash正式版在总参数、激活参数上未在原先V4-Flash预览版基础上进行任何改变,但其" 摘自公开热点词条简介 · 查看公开来源
01
核心事实
DeepSeek上线V4-Flash正式版公测,开发者社区发现其总参数与激活参数相比预览版没有任何改变,但代码与智能体能力出现明显跃升。
02
为什么重要
- 参数规模不变而能力提升,说明提升来自训练数据、方法或后训练环节
- 对开发者而言,同等推理成本下获得更强能力,直接改变模型选型的性价比
03
深层启示
值得注意的恰恰是"参数没变":同样大小的模型,换一版就明显更强,说明能力的增量越来越多来自训练方法和数据,而不是一味把模型做大。对用模型的人来说这是好消息——推理成本不变,能力上去了。大模型的竞争点,正在从堆规模挪到怎么训。
参数没变,能力上去了,增量来自怎么训。
—— 观察者 · 本篇金句
话题追踪同实体 · 跨刊期 10 条
今天DeepSeek新论文作者名单超过130人DeepSeek发布Agent训练沙盒平台DSec论文,作者超130人。DeepSeek627.4万昨天DeepSeek新论文作者名单超过130人DeepSeek发布Agent训练沙盒平台DSec论文,作者超130人。DeepSeek359.0万1周前我不得不把才华埋葬在昨天DeepSeek工程师发文告别手写算子,转向用AI生产算子。DeepSeek752.4万1周前DeepSeek工程师发长文引热议DeepSeek工程师:干得越好,被AI替代得越早。DeepSeek627.4万1周前DeepSeek工程师发长文引热议DeepSeek工程师:越出色,被AI替代得越早。DeepSeek358.1万1周前DeepSeek 开口说话DeepSeek开始灰度测试语音对话。DeepSeek771.5万1周前DeepSeek正式发布新模型 定价下调新结构从最小尺寸起步DeepSeek552.7万2周前DeepSeek正式发布新模型 定价下调最小尺寸,价格下调DeepSeek647.5万2周前知情人士证实DeepSeek备战科创板IPO已进入尽职调查阶段DeepSeek742.4万2周前DeepSeek新模型限时内测 烧钱更快了更快了,也更费tokenDeepSeek600.2万