最新报道:DeepSeek 是 2025 年春节期间的焦点,成为许多人第一次体验的 AI 产品。2 月 2 日,Founder Park 和 Global Ready 组织了一场闭门讨论,邀请了全球 60 余位 AI 创始人与技术专家,探讨 DeepSeek 引发的技术新方向和产品趋势。 01 DeepSeek 的创新在哪里? DeepSeek 发布了 V3 基座模型,包含 37B 激活参数,整体参数规模为 671B。R1 模型通过两步强化学习和两步 SFT,致力于成为最强大的推理模型。R1-Zero 模型跳过传统微调,直接通过强化学习进行推理优化。 02 为什么 DeepSeek 的成本这么低? 模型的稀疏度高,推理时激活参数小。MoE 架构在高负载下动态调整资源使用率,成本压缩到原来的 1/256。DeepSeek 对训练框架和管线做了大量调整,摒弃 Tensor Parallelism。 03 Chatbot 不一定会是用户的第一款 AI 产品 DeepSeek R1 结合搜索功能,提供全新体验。AI 领域应用型公司的竞争壁垒在于产品体验。 04 垂直场景 AI 落地更容易了 在垂直领域,DeepSeek R1 的效果好且成本可控。使用监督微调或类似方法解决耗时的数据集查询。 05 国产芯片有望解决推理算力问题 国产芯片的瓶颈在于流片。DeepSeek 适配华为以保证稳定的训推。 06 更强大的 Agent 、以及跨应用调用能力 agent 的能力提升,可能无法在所有垂直领域泛化。2025 年可能成为智能体元年,跨应用调用能力将成为热点。