TL;DR:
随着AI模型触及通用互联网数据的“能力天花板”,企业真实工作流(Real-world Data)已成为下一代AI进化的核心驱动力。数据竞赛正从人力堆叠的标注工厂,加速向基于强化学习环境(RL-as-a-Service)的深度技术整合转型。
工业文明的最后一块拼图:真实工作流数据
过去几年,AI的爆发建立在对互联网“公开数据”的掠夺性开发之上。然而,当模型处理的任务长度从简单的问答上升到端到端的项目交付时,人工编写的沙盒环境已无法还原企业真实流程中的历史状态、复杂的依赖关系以及潜在的突发错误。1
这种趋势标志着模型训练的一场范式转移:从“静态知识抽取”转向“动态决策模拟”。对于模型实验室而言,数据不再是用来检索的文本,而是模型必须置身其中去“试错、复盘、优化”的仿真环境。
数据供给侧的阶级分化:人力工厂 vs. 环境工厂
我们观察到市场上出现了两类泾渭分明的公司,它们构成了当前AI供应链的缩影:
- 人力数据公司 (Human Data Company): 依然深陷在“Type 2”数据的泥沼中。通过雇佣专家手工设计任务并标注,它们为模型提供早期的能力爬坡动力。但在高复杂度任务下,这类数据往往因为缺乏“工作流意图”而显得失真。
- RL-as-a-Service (RLaaS) 厂商: 这是真正的“技术军火商”。它们不只是交付标注数据,而是通过构建一套完整的、可循环的业务执行环境,将企业的真实工具链(如CRM、代码仓库、审批流)转化为模型训练的“游乐场”。
“如果你是一个VC,不应该投资一家对 Type 1(真实工作捕获数据)没有任何路线图的公司。” —— 这不仅是资本逻辑,更是技术演进的必然。1
评价体系的重构:从 Pass@1 到 Hillclimbability
目前,许多AI实验室正处于“Eval失真”的迷雾中。当供应商为了制造“模型潜力”的假象,不断调高评测难度时,研发者必须警惕。一个科学的指标应当是 Hillclimbability(爬坡能力):任务边界应当刚好卡在模型能力极限,让模型通过多次尝试(Pass@32)能够触碰到成功路径。
正如Jason Wei所提出的“Verifier's Law”,任何可被衡量的行为都可被优化。2 企业在这一过程中应关注:
- 数据独特性: 通用模型难以理解的内部决策逻辑,是企业的护城河。
- 采样效率(Sample Efficiency): 利用OPSD(经验压缩)和Dreaming(内部模拟),让模型在有限的交互中快速迁移规律。
未来图景:企业即实验室
未来3-5年,企业不再只是AI的买单者,而将成为训练数据的核心生产者。对于 Harvey 或 Cursor 这类垂直应用厂商而言,自研模型以降低对通用API的依赖、捕捉最核心的 Agentic Trajectory Data,已成为战略层面的“生存自救”。
在这种格局下,企业的数据策略将遵循:数据独特性 × Eval清晰度 × 任务频率 × 单次改善价值 的ROI公式。这意味着,未来不仅会涌现出专门的“环境架构师”岗位,整个AI产业链将更倾向于“小模型+深环境”的垂直组合,而非单纯的参数堆叠。