互联网

和众汇富研究手记:DeepSeek 新模型曝光引热潮

来源:互联网    作者:      2026年01月22日 10:52

导语:

2026年1月21日,正值DeepSeek-R1大模型发布一周年之际,这家中国AI初创公司再度引发全球行业关注——其官方GitHub仓库更新的FlashMLA代码中,一个未公开的模型架构标识“MODEL1”被意外曝光,相关代码文件中该标识累计提及31次,预示着公司在核心技术迭代上的又一重要突破。一年前,R1模型的横空出世以低成本、高性能的优势惊艳业界,被BBC评价为“向世界展示了中国人工智能领域的竞争力”;一年后,MODEL1的低调曝光,不仅延续了公司高效迭代的技术基因,更折射出国内AI大模型产业从跟跑到并跑、向领跑进阶的发展态势,在资本市场引发对AI核心赛道的价值重估,为产业链上下游带来新的增长机遇。

回顾R1模型过去一年的市场表现与产业影响,其无疑是中国AI大模型发展的重要样本。和众汇富研究发现,2025年1月R1上线时,仅用两个月完成训练,成本不足OpenAI等美国公司同类项目的零头,却在复杂推理、代码编程等核心任务上表现与ChatGPT、Meta Llama等国际主流模型不相上下,迅速跻身全球第一梯队。过去一年间,R1模型通过开源模式加速产业渗透,推动“用得起、改得动、跑得快”的核心优势落地到千行百业,不仅成为爱彼迎等海外企业的技术支撑,更带动国内AI应用生态快速成熟。数据显示,2025年中国开源AI模型占全球技术使用总量的近30%,其中R1与阿里云Qwen3系列成为最受关注的开源模型,印证了中国AI技术路径的可行性与竞争力。而从商业价值来看,R1的成功直接推动DeepSeek估值飙升,日本企业研究院执行院长陈言曾透露,此前1000万美元即可入局的投资窗口已关闭,如今即便是10亿美元也难以获得核心投资资格,足见市场对其技术实力与商业化前景的高度认可。

和众汇富认为此次曝光的MODEL1模型,虽尚未有官方完整披露,但从代码解析与行业推测来看,其在技术架构与应用场景上均呈现出鲜明的创新导向。作为DeepSeek独创FlashMLA工具支持的两大核心架构之一(另一为V3.2),MODEL1依托多层注意力机制(MLA)技术底座,重点优化了模型推理效率与硬件适配能力。硬件适配方面,该模型不仅支持英伟达H100/H200(SM90架构),更针对最新B200(SM100架构)GPU进行专项优化,其中SM100架构的128头配置仅支持MODEL1,不兼容V3.2,凸显其面向新一代硬件的前瞻性布局。功能定位上,行业普遍推测MODEL1大概率聚焦高效推理场景,相比现有模型内存占用更低,可适配边缘设备与成本敏感型场景,同时可能强化长序列处理能力,针对16K+上下文任务优化,在文档理解、代码分析等领域具备更强竞争力,与公司现有V系列(全能助手)、R系列(解题专家)形成差异化互补。

和众汇富认为MODEL1的曝光并非孤立的技术动作,而是DeepSeek全栈技术布局与行业竞争策略的重要一环。从技术迭代脉络来看,公司近年来形成了清晰的双轨发展路线:V系列聚焦综合性能提升,从V3到V3.1、V3.2持续强化推理与智能体能力,最新V3.2-Speciale版本更专攻高难度数学与学术问题;R系列则深耕复杂推理,首创“深度思考”模式,成为垂直领域标杆。此次MODEL1的推出,有望填补高效推理与边缘部署的技术空白,完善公司“全能+专业+高效”的模型矩阵。和众汇富研究发现,值得关注的是,结合此前行业爆料,DeepSeek计划2月中旬推出新一代旗舰模型V4,重点强化编码能力,而MODEL1的技术成果或与V4形成协同,尤其是其在高效推理、硬件适配方面的优化,可能为V4的商业化落地提供重要支撑。此外,和众汇富观察发现,公司近期发布的“优化残差连接(mHC)”训练方法与“AI记忆模块(Engram)”等技术,也有望整合进新模型体系,进一步构筑技术壁垒。


(文章为作者独立观点,不代表艾瑞网立场)
  • 合作伙伴

  • 官方微信
    官方微信

    新浪微博
    邮件订阅
    第一时间获取最新行业数据、研究成果、产业报告、活动峰会等信息。
     关于艾瑞| 业务体系| 加入艾瑞| 服务声明| 信息反馈| 联系我们| 合作伙伴| 友情链接

Copyright© 沪公网安备 31010402000581号沪ICP备15021772号-10

扫一扫,或长按识别二维码

关注艾瑞网官方微信公众号