DeepSeek-R1 发布:推理模型以 MIT 协议开源,企业应用该怎么选
2025 年 1 月 20 日,DeepSeek 发布推理模型 DeepSeek-R1,模型与技术报告以 MIT 协议开源,同时开源多款蒸馏小模型,API 输出允许用于微调和蒸馏。
发生了什么
2025 年 1 月 20 日,DeepSeek 发布推理模型 DeepSeek-R1。官方公告称其性能对标 OpenAI o1,模型和技术报告全部开源,采用 MIT 许可协议,明确允许 API 输出用于微调和蒸馏;同时开源了 6 个蒸馏小模型。开发者可以通过 API 以 deepseek-reasoner 的模型名调用 R1,普通用户也可以在 DeepSeek 网页对话中使用「深度思考」模式体验。
推理模型和普通对话模型有什么不同
推理模型在给出答案前会先进行较长的思考过程,适合多步推理、数学、代码、复杂分析类任务。代价是响应时间更长、消耗的 token 更多。对于简单问答、文案生成、信息抽取等任务,普通对话模型往往更快、更省。
对企业项目意味着什么
R1 让「深度思考」在国内用户中迅速普及,客户对 AI 回答质量的预期也随之提高。但在企业系统里,并不是所有环节都应该用推理模型。例如官网客服首轮应答需要快,适合对话模型;合同条款比对、复杂报价规则校验则可以考虑推理模型。MIT 协议也让企业在商用、二次开发和私有化部署上顾虑更少。
另外,推理模型输出的思考过程可能很长,其中也可能包含不适合直接展示给终端用户的中间内容。面向客户的产品界面,通常只展示最终答案,思考过程可以折叠显示或仅在后台保存用于排查。是否展示、如何展示,要结合产品定位和内容安全要求来决定,不能简单照搬通用对话产品的做法。
可以怎么做
- 按任务类型分流:简单任务用对话模型,复杂推理任务用推理模型。
- 为推理模型设置合理的超时和最大输出长度,避免前端长时间等待。
- 需要结构化输出(如 JSON)的环节,先验证推理模型的输出稳定性。
- 评估私有化部署时,从蒸馏小模型开始测试,确认效果满足需求再考虑更大模型。
来源:DeepSeek API Docs api-docs.deepseek.com/news/news250120