E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长

播放真实单集
Episode Summary真实 show notes
随着AI模型能力提升,训练需求更复杂,一批为模型公司提供训练数据的新公司正在快速增长:AfterQuery今年4月宣布A轮融资时,估值为3亿美元,到了9月,据媒体报道,新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs,也在今年7月宣布,种子轮与A轮融资合计达到4000万美元。 虽然估值水涨船高,AI数据行业对外界来说却极其不透明。问题来了:这些公司究竟在卖什么? 过去提到数据标注,我们容易想到给图片打标签、给模型回答打分。但随着AI从回答问题走向执行任务,数据公司的交付物也在变化:从专家写出的评分标准,到包含任务、工具和验证机制的强化学习环境。它们需要找到懂行的人,获得真实的行业资料,再把专业知识与工作经验转化成模型能够学习的训练信号。 与此同时,新的AI评测层出不穷。榜单分数提高了,究竟代表哪些能力变强了?针对评测生产数据,什么时候能改善真实用户体验,什么时候又会变成单纯的刷分?对于每天训练模型的研究员来说,他们最需要的数据,到底是什么? 本期节目,我们邀请到在Scale AI负责后训练与评测研究的何允中,以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀,从产业与研究两个视角,拆解这门透明度不高、又变化极快的生意。 我们聊了Scale、Mercor、Surge等数据公司的不同背景,也讨论了小团队在合成环境与垂直领域中的机会。从采购一份游戏源码,到验证专家提交的任务,再到设计让人愿意交出经验的激励机制,好数据的难点,往往藏在榜单之外。 【主播】 Yiwen,硅谷101主持人 【嘉宾】 何允中,Sc
Business Vocabulary规则派生 · 可核对
ai
Marketing Insight规则派生 · 可核对
商业启示与英文表达将由此基于真实内容萃取。当前为结构占位,不生成虚构事实。