DeepSeek-V3 发布并开源:国产大模型接入成本的一次转折
2024 年 12 月 26 日,DeepSeek 发布并开源 DeepSeek-V3,采用 MoE 架构,总参数 671B、每个 token 激活 37B,API 保持兼容。国产大模型接入企业应用的选择由此明显增多。
发生了什么
2024 年 12 月 26 日,DeepSeek 发布 DeepSeek-V3 并同步开源模型权重和技术报告。DeepSeek-V3 采用混合专家(MoE)架构,总参数 671B,每个 token 激活 37B,预训练数据规模为 14.8T tokens。官方 API 的 deepseek-chat 同日升级到新模型,接口保持兼容,已有调用方无需修改代码。
对企业 AI 项目意味着什么
在此之前,不少企业想在官网客服、商品描述生成、知识库问答中接入大模型,但顾虑效果和成本。DeepSeek-V3 的发布让国产模型在通用对话、代码、数学等任务上有了更多选择,也让「开源权重 + 兼容 OpenAI 接口」成为国产模型的常见形态。对开发团队来说,这意味着同一套调用代码可以较低成本地在多家模型之间切换。
开源权重也为私有化部署提供了可能。对数据敏感、希望模型运行在自有环境里的企业,可以评估自建推理服务的可行性,但需要考虑算力投入和运维成本,并不是所有项目都适合。
需要注意的是,模型迭代速度很快,官方接口背后的模型版本可能随时升级。DeepSeek 此后也陆续发布了新版本,例如 2025 年 3 月的 DeepSeek-V3-0324。对企业系统来说,这意味着同一段提示词在不同时期可能得到不同的输出,关键业务环节要有回归测试,模型升级后先验证再放量。依赖固定输出格式的功能,例如自动填表或结构化抽取,尤其需要做好格式校验和失败兜底。
可以怎么做
- 在系统里把模型调用抽象成统一接口,不要把某一家的地址和参数写死在业务代码里。
- 为每个业务场景准备一组测试问题,用它比较不同模型的实际效果,而不是只看公开评测。
- 记录每次调用的 token 用量,便于核算成本。
- 面向公众提供服务时,同步考虑备案登记、内容标识等合规要求。
来源:DeepSeek www.deepseek.com/en/news/deepseek-v3