米拉·穆拉蒂的企业AI战略 | AI生成和翻译
问题: Mira Murati的Thinking Machines押注于开放/可定制基础模型加企业微调,是否可能因企业数据规模太小而失败?真正的竞争是否在于推动像GLM或Anthropic这样的智能体/代理?
回答:
你的直觉指向了AI市场中的一个真实矛盾,但结论略显绝对。
关键区别:
“企业级微调” ≠ “用企业数据训练智能”
至少存在四个不同层面:
互联网规模预训练
|
v
基础模型智能
|
v
后训练/对齐/推理
|
v
企业适配
|
+--> 检索增强生成 (RAG)
+--> 工具使用
+--> 工作流
+--> 微调
+--> 智能体代理
错误在于假设企业微调是为了创造更智能的模型。
通常并非如此。
1. 你说得对:企业数据与互联网数据相比微不足道
就通用智能而言:
互联网语料库:
数万亿token
单个企业:
数百万到数十亿token
即便是微软这样的大公司,拥有:
- 内部文档
- 邮件
- 代码
- 工单
- 会议记录
但与以下资源相比:
- Common Crawl
- GitHub
- 书籍
- 论文
- 维基百科
- 网络论坛
仍然很渺小。
因此:
企业数据 -> 更智能的GPT
很可能是错误的。
一家银行的文档不会创造出比Claude更好的模型。
2. 但企业采购的不是”更智能的GPT”
他们需要的是:
GPT-5 + 公司知识 + 公司业务操作
示例:
一家银行不需要:
“一个更懂银行业务的模型”
它需要:
客户请求
|
v
智能代理
|
+--> 搜索内部政策
|
+--> 查询交易系统
|
+--> 调用合规API
|
+--> 生成回复
价值不在于模型权重。
价值在于集成层。
3. 微调正变得越来越不重要
这点我认同你。
2023年的观点:
“每家公司都会微调自己的Llama”
可能被夸大了。
为什么?
因为模型迭代速度很快。
示例:
公司训练了:
基于Llama-3.1的微调模型 2025年1月
六个月后:
Claude/GPT/Qwen新模型
就超越了它。
此时公司面临:
- 旧模型
- 高昂维护成本
- 不明确收益
因此许多企业转向:
强大基础模型
+
检索增强生成 (RAG)
+
工具使用
+
智能代理框架
4. 真正的战场在于智能体能力
这一点你的观点最为有力。
前沿竞争在于:
模型能否可靠完成长周期任务?
而非:
模型能否记住更多企业PDF?
竞争格局:
Anthropic
聚焦:
Claude
+
计算机使用
+
工具使用
+
代码智能体
OpenAI
聚焦:
推理模型
+
智能体基础设施
+
类似Operator的系统
GLM/中国实验室
聚焦:
开源模型
+
高效推理
+
智能体生态系统
胜者可能需要:
更强的底层智能
+
更强的推理能力
+
更强的规划能力
+
更强的工具执行能力
+
更低的推理成本
5. 那为什么Thinking Machines值得关注?
赌注未必是:
“企业数据让模型更智能”
赌注可能是:
“企业希望掌控AI系统”
例如:
开放/定制模型允许:
公司
|
+-- 选择模型
|
+-- 审查行为
|
+-- 定制安全
|
+-- 私有部署
|
+-- 集成智能体
这对以下领域至关重要:
- 银行
- 政府
- 医疗
- 国防
- 大型企业
它们往往无法将所有数据交给OpenAI/Anthropic。
6. 未来可能类似于Linux+云服务
一个可能的类比:
1990年代:
没有公司会自己构建操作系统。
但:
Linux内核
+
企业定制
+
企业软件
发展壮大。
AI可能演变为:
基础模型
+
企业智能体层
+
私有数据/工具
模型本身变成商品。
智能体系统成为差异化优势。
我的预测
市场将分化:
前沿实验室胜出领域
训练智能
推理能力
多模态能力
智能体算法
(OpenAI, Anthropic, Google DeepMind, xAI, DeepSeek等)
企业AI公司胜出领域
部署实施
系统集成
工作流自动化
安全性
评估测试
Thinking Machines正押注在第二层。
风险在于如果他们过度聚焦于:
微调自有模型
更强大的论题是:
基于前沿/开放模型的可定制智能体系统
因为,正如你所说,稀缺资源并非企业文本。
稀缺资源是让模型可靠地完成有用工作。
