LongCut logo

E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长

By 硅谷101播客

Summary

Topics Covered

  • 数据范式从rubric进化到RL环境
  • 把vibe coding的成功扩展到vibe everything
  • 评测与卖数据有不可逾越的红线
  • 数据公司真正的护城河是研发投入
  • 95%智能体任务本质上都是coding问题

Full Transcript

节目开始之前 跟大家分享一个 我们《硅谷101》 即将在湾区举办的黑客松活动 今年硅谷101将在我们的年度活动 Alignment 2026上举办 STORY101 LAB AI视频创作挑战赛 让影视创作者和AI科学家们 在现场一起探索 AI到底能给讲故事 带来哪些新的可能

无论你是已经在用AI拍片的 专业团队 还是想要尝试的新手 都欢迎参加 比赛设有探索组和专业组 我们也会提供免费的workshop培训 优胜作品 还有机会赢得丰厚的奖金 并在千人线下活动中展映 活动时间是10月10号到11号 地点在Sunnyvale的 Plug and Play Tech Center 报名链接

我们已经放在本期节目的 Shownotes里面了 另外我们Alignment 2026的 活动本身的报名 也在持续进行当中 这次我们邀请了 来自OpenAI 英伟达 Menlo Ventures Cerebras等等 公司和机构的嘉宾 期待在线下和大家对话 Hello 大家好 欢迎回到《硅谷101》 我是Yiwen 很多投资人 在和我们聊天的时候都提到了

他们最近很关注的一个赛道 那就是数据 随着模型能力的不断提升 模型公司对训练数据的需求 也变得越来越复杂 越来越具体 硅谷因此出现了一批 增长很快的数据公司 专门为这些模型公司提供服务 比如由三名20多岁的年轻人创办的 AfterQuery 今年4月宣布A轮融资的时候

估值还是3亿美元 到了9月 新一轮融资 就已经把它的估值推到了32亿美元 不到半年 涨到了10倍之多 创下了YC旗下公司 从启动到成为独角兽的最快纪录 那我们更熟悉的几家大型数据公司 估值也已经达到了百亿美元的级别 去年Meta入股Scale AI的时候

给出的估值超过290亿美元 Mercor去年10月这轮融资的估值 也达到了100亿美元 但这些高估值背后的数据生意 到底是怎么做的 外界其实很难看清 所以 我也很好奇 这些公司究竟在卖什么 模型公司 又为什么愿意给那么多钱呢 过去提到数据标注 大家很容易想到给图片打标签

给模型的回答打分 这些人工标注 现在 数据公司还需要请来 各类行业专家 把他们的知识和工作经验 转化成AI可以学习的任务 其中一类重要的数据 是请专家写清楚 一个回答 一份工作成果 到底满足哪些条件才算好 这套评分标准 也就是我们经常听到的 Rubric(评分细则) 再往前一步

数据公司还要搭出 让AI实际动手的环境 配上任务 工具和反馈机制 让它在里面操作软件 反复尝试 并且根据结果学习 这就是强化学习环境 也就是我们经常听到的 RL environment(强化学习环境) 与此同时 新的AI评测也层出不穷 从金融 法律等等垂直领域

到让Agent完成一整套工作流程 模型要参加的考试是越来越多了 但榜单上的分数提高了 究竟代表哪些能力变强了呢 针对榜单做优化 什么时候会让模型更好用 什么时候又会变成单纯的刷分行为 这期播客 我们就想把这些问题聊清楚 我请来了两位

非常适合聊数据这个话题的嘉宾 分别是在Scale AI 负责后训练和评测研究的何允中 以及加州大学伯克利分校的博士后 Agents’ Last Exam (ALE 智能体终极测试基准) 项目的研究者孙一铀 以下就是我们的对话 Hello 允中 Hello 一铀 欢迎来到《硅谷101》 大家介绍一下自己吧 OK 我叫允中 现在在Scale AI 负责post-training(后训练)

和evaluation(评测)research 大部分人关注我们 可能是看我们发布的 Benchmark(基准测试) 还有一些RL data recipe的文章 但是实际上我们其实也是 给整个大模型行业提供数据 还有一些方法论的支持 有一点像整个行业的 一个外包数据research团队 观点都是个人观点 不代表Scale AI 也跟客户没有关系

谢谢允中 我是一铀 我现在在UC Berkeley读博士后 现在关注的是 Agent evaluation(智能体评测) 这个方向 我们最近推出的工作就是 Agents’ Last Exam (ALE 智能体终极测试基准) 目标是构建迄今为止规模最大 覆盖面最广的智能体评测基准 是由Berkeley RDI 和300多位行业专家 共同领导和牵头的 是希望能够衡量

智能体在有可验证结果的长期 具备经济价值任务中的一些表现 目前的话 公开的任务大概有150多个 覆盖了50多个细分的行业 我们目标在下一次发布中 直接放出1000多个任务 在每个领域上做得更深一些 我们可能几个月内 就会发布V2的版本 允中要不要给我们讲一下 现在市面上的 因为其实也有林林总总的数据公司

你觉得大致的一个分类是什么样的 这里面有几个大的玩家 还有一些新秀 有一些几个人的作坊 在我看来最有意思的是 大家基因可能不太一样 比如说有做招聘出身的 像是什么Mercor Handshake Scale AI是这种传统数商 从众包网络出身的 也有一些新的是做合成的 还有在最新的一些

可能是某一些领域公司 转行做数据了 这里面值得说一下是这个具身 具身现在的行业状况 是有很多做模型的公司 暂时没赚到钱 但是它花了大量精力 投资做素材 就顺便做起了素材生意 很多各行各业的人 也发现了自己的数据的价值 然后转行来做这么一个数据公司 我觉得大致有这么几个分类 几个大的玩家

比如说像是Mercor Surge AI Scale AI 基本上试图什么东西都能cover 除此之外 其实一些新秀玩家 把一些领域做得比较好的 像是什么BigCode或者Snorkel AI 他们可能是比较偏research(研究) 跟engineering(工程)一点的 我猜测他们主要生产代码 或者是tool call(工具调用) 这一类的环境 就是抓住了今年的这么一个风口 另外我还看到一些小的公司 他们可能是解决了一些 垂直领域的问题

甚至他们可能不像我们 是做标注数据的 就是一些broker(数据经纪商) 比如说可能是好莱坞的一个人 他有特别多的版权数据 他知道怎么把这东西卖出去 就是有林林总总的不同领域的东西 然后现在可能在最新兴起的 就是做这些垂直领域 把一个领域做得特别好 可能是由一些领域的专家组成的 大概是这么几个分类 我会觉得说机会还很多

大的数商有大的数商的优势 就是想进入一个领域 有比较多的资源 我觉得整个饼是越来越大 你讲到说像Mercor Surge AI 这样的公司是所谓的招聘公司 这个能不能再给我们具体讲一下 招聘是一个什么样的商业模式 Surge AI应该不是 但是Mercor是做招聘起家的 它有自己的一个自动AI面试的 这么一些产品

它可能主打的重点就是 我能够在比较短的时间内 找到足够量的专家 有这么一个专家网络 Surge AI我觉得更多的是 把这个东西in house(内部来做) 这里反正有一些取舍吧 基本上每个数商 可能都需要面临这么一些取舍 就是说如果我是自己 完全全职培养的人 那他肯定能力强一点 但是这个灵活度就不够 产能可能会差一点

如果是更多地依靠众包的网络 可能我的灵活性大一点 但是每个人的质量就比较难保障 这里面就涉及到一些质检的问题了 比如说像Scale AI 这些公司的一些优势 就是说我们有一些质检的经验 不光是在数据上 也在人上 允中要不要讲一下 你是什么时候加入Scale AI的 在当时到现在整个市场 你觉得对于数据的需求 有发生什么变化吗

对 故事还挺好玩的 当时我是在Meta入股之前 签的offer 我一到人就走了 所以我经历了整个大模型行业开始 不管从人才的战争 还有薪酬体系都开始 Go crazy的这么一个故事 当时我来之前 我的老板刘冰跟我说 有这么一个技术 各个家lab(实验室)都在做 但每个人都做得不太一样

说你赶紧进来 我就能跟你讲 我们在这里好好做些研究 然后我来了 那个时候是 Rubric data(评分细则数据) 那个时候还比较新 可能一年多之前 现在Rubric感觉已经过时了 大家都在讲 RL environment(强化学习环境) 各种各样的东西 就是这一年确实经历了 非常多的变化 其实我们关注这个话题 也是因为大概从2024年到现在 感觉整个对于数据的一个需求

发生了一个比较大的变化 因为2024年之前 我们在聊数据的时候 大家想到的很多还是人工标注 就是一些比较基础的数据 我们会需要非常多的数据 来做pre-training(预训练) 来训练模型 但是从2024年 其实Mercor之前有提到过 是因为Deep Search的兴起 导致整个行业转移到了一个所谓的 Agentic data(智能体数据) 我们会需要 像你刚刚说的rubric(评分细则)

包括RL环境 现在就是更多真实工作流数据 能不能帮我们先梳理一下 这几个概念 我们先讲一下这个行业从 Crowdsourcing data(众包数据) 就是这些人工标注数据到 Agentic data(智能体数据) 这个中间是经历了 一个什么样的变化 对 首先说明一下 Pre-training(预训练) 还是很重要的 不过就确实 从我身边的人的兴趣来说 大家经历了一个转向 大家觉得pre-training

感觉干得有点无聊了 就是再继续Scale调数据配比 那个时候是o系列模型出来了 大家都在做reasoning(推理) 发现这RL跑通了 一下子大家兴趣都在RL上 RL比较有意思的一个问题就是说 我需要一个可验证的信号 可验证的信号在代码或者数学 尤其是最早的推理模型 是从数学上做出来 就很简单 我这个选择题答错答对了就知道了 或者就是一个数字算出来

但是之后大家就在想说 那我数学可以做RL了 我在其他领域呢 比如说像是这些什么医疗 金融 或者就是更基础的指令遵循 这里我能不能做RL 这里它存在的一个问题就是说 它是有一些客观标答的 不像在之前的一个阶段 大家做RLHF(基于人类反馈的强化学习) 就是reward model(奖励模型) 可能没什么标答 只是把大家的喜好学出来 这里面其实是有个标答

只是它这个标答它比较不结构化 就好像我去答历史考题 历史考题是有标答的 但是每个人的写法可能都不太一样 就我很难做这个 Pattern match(模式匹配) 就是说A B C D检查你有没有答对 这个时候就是一个 Rubric(评分标准)的方式 相当于我让一个TA(助教) 拿着教授写的打分规则来给你打分 因为这个打分规则是提前标好的 是教授写的

所以这个TA也不需要特别聪明 这是整个大模型数据中的 一个核心概念 就是叫 Weak-to-strong supervision 就我能不能用弱模型来监督强模型 那它这里成立的条件就是说 我有个专家把他脑海里的知识 给写下来了 这样弱的模型拿着它改卷子就行了 这就是rubric data(评分细则数据) 这个东西应该是火了很长一段时间 当然现在还很重要 但是这里面 很快就把各个专家领域的rubric 而且比较容易获得的

收集得比较干净了 看到比如说像 Mercor或者Surge AI的崛起 其实跟这一块的专家rubric有关系 但是再往前走 就大家需要动手了 比如说现在做这种代码模型 或者像一铀他们做的ALE 虽然它不是做代码 但它需要“动手” 要解各种各样的问题 这个时候 它就不再是说 我只是验证你一个聊天的输出了 那我需要是在一个Agent的 Setting(环境)之下 那我可能需要给它一些工具

还有一些更复杂的验证方式 它还包含了rubric 但是可能我需要一些 检查这个环境里面的变量 是不是执行了 这个数据库是不是写入了 或者被删除了 甚至如果像是我生成一些文档 里面可能有些图 这个东西我还是需要rubric 但是我需要一个agent来检查 它就变得更加多样了 现在可能大家追求的 比较大的一个方向就是环境 它不光是我标注好的 一些打分规则了

而是说我可能包含了一整套 我要做什么 在什么样的环境里面做 包括了它需要的一些工具 需要执行的一些沙盒 以及还有一套跟task比较相关的 验证方式 验证方式非常的多样 比如说有这种 Programmatic check(程序化检查) 有这种rubric 还有preference(偏好) 我让人选我比较喜欢哪一种 这里面我暂时还没有形成 特别大的共识 我又看到有点像当年rubric时代

每一家要的东西都不一样 比如说像什么 Terminal-Bench(终端任务基准) 他们就不要rubric 他们就是纯programmatic 这里面也有不同的流派 还挺有意思 这个很有意思 一铀 你要不要从ALE的具体的例子 来跟我们讲一下需要哪些要素 其实我跟允中的看法 有一点反过来了 允中认为现在rubric 差不多已经做到头了 但我的看法是 我觉得rubric这一块 意思专家那种主观的判断题

其实还做得远远不够 我可以先从ALE的初衷讲一下 ALE是当时建立的初衷 就是跟允中讲的一样 就是我们怎么样把 Vibe coding(氛围编程) 迅速发展的这趋势 推广到vibe everything 当时vibe coding 为什么发展那么快 就是因为当时有非常非常多的 Benchmark(基准) 都在coding这个领域 而且coding 它比较容易verify(验证) 它是一个确定性的rubric 大家为了刷这个榜

所以在coding这上面发展非常迅猛 那么用同样的思路 我们如果在其他的各个领域上 尤其是工程 能够客观打分的这些领域上 能够建立各种各样的这样评测体系 你去刷分 但你只要刷的是有益的分 是有意义的题 那它模型带来的提升 对于人的日常工作来说 就是实打实的提升 所以这就是我们当时 想建立一个这样的初衷

当然世界上大家职业各式各样 实在是太多了 浩如烟海 所以我们只是说 在第一个版本里面 给出了一个相对来说 覆盖面比较广的初次的一个尝试 然后我们还会继续努力 希望把这个覆盖得更广一些 到某一天希望它能成为真正的 LAST EXAM 就当你解决这个benchmark的时候 基本上就能解决人类社会 在某些领域的真正的有益的问题 我同意一铀的观点

各个领域的训练 肯定是远远没有到头的 很多东西都可能还没有被 Rubric的方式表征出来 所以这里面还有很大的空间 可能我刚刚说rubric到头了 更多的是个行业趋势 就这种静态的单轮或者多轮聊天 出一个文本 然后用rubric来检查它 就是纯知识类的 甚至也不是说到头了 因为毕竟还有不同的lab 每家的水平都不一样 只是说今年的一个大趋势

是在做这个coding 然后coding逐渐转向了 Knowledge work 大家要动手了 这个时候 就是纯这种文本的rubric 我看到需求量小了一点 但还是很大 还是有很多东西没解决 就允中刚才提到了 对于很多这种文本式的输出 比如说它文章写得好不好 你可能有些这样打分的点 但是事实上对于工程领域的 一些产出 其实有很多的评测 我们确实发现了

除非你把输入固定得特别死 不然它的输出 其实有非常非常多的可能性 我举个例子 你让它生成一个游戏 甚至有些数学解法它都不是唯一的 那这种情况下 如果你给一个确定性的评判 就是你一定要跟你这个 Ground truth(标准答案)来对比 那很多时候就会造成 不一致的这个问题 所以说很多时候说 我们怎么样定义这个rubric 让它能够兼容这种多式多样的输出

其实这也是我们在构建benchmark中 遇到的问题 也是未来想要去 思考解决的一个方向 稍微抛砖引玉一下 我的一个想法就是 未来的这个发展趋势可能会 比如说人类他对于一些好玩 好看 他没有办法把它固化下来 成为一个可以被量化的指标 比如游戏好不好玩 但实际上有些游戏的入门教科书里 其实是有各种各样的评判的方式

比如说它奖励曲线是不是平滑 符合大脑的多巴胺的 它是有科学的指标 可以去量化这个好玩 和好看这个东西 但我目前在现在的这benchmark上 我还没有看到一个 做得特别完整的 公开出来的评测体系 因为这个东西难度也确实非常高 因为需要专家的 更加更加深度的参与 所以这一点我也想看看 允中那边关于在数据公司里 有没有看到这一个趋势

或者怎么去解决这一类的问题 对 这个问题特别好 这也是每天我们在绞尽脑汁的问题 其实整个rubric 或者整个大模型的验证体系 我觉得它整体上是有这么一个思路 大家希望左脚踩右脚 就是当我的模型变强了 我这个验证器也变强了 验证器变强了之后 我就可以允许一些更复杂的rubric 就比如说如果我是一个 很弱的验证器

那么我就只能写一些 就是一个傻子都能看出来 就知道是对还是错的这个rubric 但是 随着这个模型能力的提升 那我的rubric 就可以写得越来越模糊 可以把更多的知识 交给验证器来解决 但是我觉得这里总体的一个思路 还是说这个rubric加上验证 这两块加起来的知识和能力 应该比我要训练的模型要多 不然就达不到训练模型的目的了 那么就回到

比如说像是这种做video game 这种特别特别主观的东西 对吧 我觉得未来可能是这样的 你可能很难把它以很显式的条件 一条一条写下来 一个好的游戏是怎么样的 它可能有多种多样的可能 所以这个时候我的rubric 就会被迫写得更加模糊 这个东西 就by the way 其实不是我们想要的 就通常来说我们会建议 这个rubric写得越严谨越好 但是在某一些领域 你可能就必须要写得很模糊

这个时候需要验证的模型 来自己做一些主观的判断 那这个验证的模型 我觉得甚至有可能是 我要训练一个 Reward model(奖励模型) 我知道 比如说在不少lab里面 当然这不是客户透露给我们的东西 是我自己的一些经验 比如说生图 生图它有两个部分 一个是Instruction following(指令遵循) 有没有遵循我的这个要求 比如说我图里面有猫有狗 有一个背景板写了哪几个字

这个时候我是会有rubric 我就写这里要有一只猫 那里有只狗 甚至我跑一下OCR(光学字符识别) 把那个字提出来 然后看看是不是我想要的那几个字 就这一块是属于rubric 但是还有一块 就是说这个字要写得好 这个猫要是一只可爱的猫 这种东西就是我可以写成rubric 但它非常主观 那我可能甚至专门训练一个模型 就这个模型它可能 掌握了一些人类的主观体验

这些东西可能跟rubric结合在一起 大概率这个问题如果要解决的话 可能是这么一个混合的方向 因为我们刚刚好像把rubric和环境 这两个事情 好像是放在对立面来说的 但是听起来 一 它们是可以结合在一起使用的 二 有没有一些任务 是用rubric来做会比较好的 或者用环境来做比较好的 我觉得这个肯定是不能拆开来讲的 环境或者说任务数据 它只是一个执行的基准

但是rubric是最终用来打分 用来奖励模型做得好还是不好 所以它肯定是相辅相成 又必须结合在一起来看的 我个人更希望 去从一个任务分类的角度去看 而且人和agent这两个角色 如何去合作 它分别担任一个什么角色 这也很重要 我们从历史上来看 就是从最早期 Vibe code刚出来的时候 就大家用cursor 其实就是一个

人类也是参与在执行这个代码当中的 Agent它只负责执行很小的 一个模块的一些写代码 后来随着agent能力越来越强 Agent就你给它一个非常模糊指令 它能够完成一个非常大的 Project(项目)的时候 那这个时候人和agent角色 又产生了一些变化 那现在它可以大致分成这两类 就是人负责决策 Agent负责执行 人把你决策的东西说得越清楚 Agent就能做得更好

基于这两个分类 我们来看rubric该如何去设计 如果我们需要agent参与的角色 它只是执行 就你如果把一个任务说得很清楚 它的输出基本上是固定的唯一性的 那这个东西rubric 它就是一个确定性的rubric 它打分的话 就是完全可以基于 你自己做出来的一个成品 来进行打分 因为它一般会有 Ground truth基准数 如果咱们讨论未来数据需要什么样 就是当人的决策的这部分

会不会也被agent所慢慢去取代 那这一部分就是我觉得会回到 之前允中说的 大家现在反而没太重视这些rubric 因为决策很多是非常模糊 很难去量化 而且允中说 你对一个具体的domain(领域) 猫可不可爱 你可以train一个这样的verifier 但是对于一个 尤其是一个上市公司 一个领导层的一个决策 你该如何去train一个reward 它每天的任务都在变

你很难去收集到足够的数据 让你来训练出 这样一个reward model 来替你做这样的决策 所以我个人认为 在这一块的模型的发展 还有很长的路需要去走 而且这可能是会成为 一个未来发展趋势 这里我特别同意 就比如说ALE的这个方案 我觉得就是面向未来 比如说像这个猫可不可爱 比如说我要是在这个Meta 我有一些用户行为的反馈 我可以训这个模型

但是公司的决策 我就很难收到这些数据了 比如说像ALE这种 就让大家把以往做过的东西 还有决策交起来 其实是一个方案 我会觉得以后收数据可能是 大家怎么样找到好的激励方式 让大家把一些重要的东西交出来 尽量地能够回溯 当时这些重要的决策 非常有意思 我想再追溯一下评测的 近几年的整个一个发展

以及它和卖数据之间的关系 因为其实我和两位私下都聊过 就是卖benchmark和卖数据 这两件事情 大家都觉得不能混为一谈 Scale AI之前推出了 Humanity’s Last Exam 就是HLE这个评测 能不能给我们讲一下这个评测 以及你觉得它和数据之间 是怎么样联系起来的 这是个好问题 我觉得从原理上来说 评测它体现的是模型

距离我们想要的理想状态中间的gap 就是它更多的是一个科学研究 这么一个基准 就是我想要模型在哪 它现在没到哪 但是这个事情跟卖数据联系起来 也比较有意思 因为很多时候 它提升这个模型能力的数据 和它榜单的评测方式是息息相关的 这里面可能比较难的 是找到一个平衡 如果我就生产大量的

跟这个榜单差不多的数据 那么它可能就在 Bench-maxxing(刷榜) 但是 就是这个大模型训练 还是有各种各样的维度 确实如果我想要提升某一类的能力 我需要抓住某一个维度 那么就是说它跟benchmark 肯定是有一定的相关性 这个是大家需要找到的一个平衡 因为大家对AGI的期待太高了 觉得人能做到的事情它都能做到 那么就是说我在各种各样的领域

都可以想到一些方式 构造一个benchmark 然后发现它这个模型 距离你想象当中还有一些差距 通常构造这个benchmark的人 对于这一块的领域可能认识比较深 就自然会给他一定卖数据的权威性 大家会比较相信你手上卖的数据 这个生意就这么产生了 我相信 一铀应该也 就ALE现在做得火的benchmark 应该也有不少人想问你卖不卖数据

或者是有可能VC也想找你投资 结果逐渐逐渐地就成了一个生意 我觉得就是也有好有坏吧 就是说这个生态 其实也还比较野蛮发展 有多少是在做科学 多少在做bench-maxxing 我觉得确实需要仔细权衡一下 但是这确实是有很多的利益驱动 所以现在是个挺繁荣的市场 对 这里的话 我也是要给大家敲个警钟 因为允中提到了 现在做benchmark的人

会收到各种各样的诱惑 就是要去把benchmark数据去卖了 我甚至我私下听到 是有一些数据公司 它踩了这个红线 就是它把自己在做评测的数据去卖 当然这个是 大家千万不能碰的一条线 不能让你做的生意 污染你这个benchmark的权威性 不然的话 你不仅毁了你的benchmark 也毁了其他人的模型 我个人认为benchmark和卖数据 这两个东西角色是不一样的

在这个生态系统里的地位是不一样 我认为benchmark面向的是未来 做数据面向的是现在 Benchmark是面向于未来 大家还希望这个模型公司 去解决目前还没有解决的什么问题 ALE 其实我们在今年1月份 2月份 做的时候 我们特别害怕benchmark做得太难 导致这个benchmark失去意义 因为当时的模型 很多基本上平均分只有10%到20%

大部分题目它都只有拿到零分 我很担心这样的评测它会失去意义 但事实上没有必要担心这个事情 因为benchmark本身就是要 面向于未来的模型去做的 数据的话更多是去解决 这个benchmark所产生的一些需求 所以说 更说是现在 大家在刷这个榜单 怎么样去把这东西做好 我认为benchmark-maxxing(刷榜) 它有好有坏 你只要面向了它这个数据 它不是直接污染你这个benchmark 你这个benchmark

刷的又是有意义的一个榜单 只要这个benchmark 和人的真实用户的体验非常接近 我觉得这bench-maxxing 它不一定是一个贬义词 对 bench-maxxing 这件事其实特别有意思 因为一方面 我们确实需要一个评测的基准 另一方面你又不希望模型公司 为了刷评测而去刷评测 我觉得这里很自然就产生一个问题 就是什么样的评测 才是有意义的评测 因为我们现在一周就感觉可以看到

很多新的benchmark 比如说从模型公司的角度来说 他们应该怎么样去选 去刷哪些评测 或者把哪些评测作为他们下一步 提升模型能力的目标 从你们供应商 还有researcher的角度来看 你是怎么样去看待这件事情的 我觉得做模型能力提升 最大的ROI还是我要放在能力上 这些能力提升了 它应该是惠及各个benchmark

当然就可能有些人有不同观点 因为就对于一些模型厂商来说 应用也非常重要 就比如说如果我的这个benchmark 是比较贴近一个应用场景 他们其实有动机 就把这个场景做好 对他们也是有益的 最有意义的事情是 大家至少口头上还是奔着AGI去的 那我应该考虑 哪一些核心的认知能力 是我需要提高的 那么它体现在benchmark上 就是说我可以看到一些泛化性 如果我做了一个提高

它只涨这个 别的都不涨 那么可能有一些不好 所以就回到一开始的问题 未必是说怎样的一个benchmark 是最好的 还是说不同的benchmark 它测试了不同的东西 我可能要关注的是 哪一些共同的能力 能够让它们一起提升 而不是说我只专注于 优化同一个benchmark 另外再回到benchmark本身的问题 我倒是觉得除此之外 大家确实会关心一些

贴近场景的benchmark 如果这些场景是大家在意的 它确实反映了这个用户体验 这也是个好benchmark 它未必是那么universal 未必是那么大的朝着AGI去的 但是它就确实体现了大家的体验 在这个角度上来说 Benchmark肯定是有千奇百怪 就你总会找到一个场景 我觉得可能是两个要素 就是说这个场景的这个gap 它是不是体现了

一个非常具体的能力的缺陷 如果只是因为这一个场景 一些场景知识不太懂 同时这个场景又不太重要 就是我在一个犄角旮旯里面 我解了一个什么很奇怪的智力题 出了一个benchmark 这个能力提升了 未必代表这个模型 本身的认知能力提升了 那么可能 就不是一个好的benchmark 另外一块就是说 就算不反映核心的能力 它至少反映一个大家在意的场景 比如说现在特别火的

是personal assistant(个人智能助理) 就是现在这个Muse 这是一个很具体的场景 大家都希望有这么一个东西 那么这个benchmark 它甚至未必测的是模型本身 它可能还测了 你的harness 最后这个benchmark 它甚至不是为了卖模型的训练数据 而是告诉你我的harness错在哪 可能我可以做些工程优化 就是贴近大家需求场景的benchmark 也是好的benchmark 所以在我看来 一个是反映了核心的认知能力 一种是贴合场景

当然两个都有的话是最好的 我觉得最重要的 现在大模型公司很看重的一个 就是benchmark的分布 大家应该可能都听说过 Artificial Analysis 这个评测体系 他们其实做的事情很简单 就是把各家benchmark 给不同的权重 然后把它综合到一起来 得到一个分数 但这样它就存在一个问题 它分布的这个权重 是不是真的是大伙需要的权重

这个权重以什么方式去进行迭代 这个都是挺主观的一个事情 大家质疑的更多不是这个模型本身 而是质疑这个榜单本身 我现在倾向于认为大家 可能benchmark还不够好 做到大家心目中要的 Distribution(分布)那种级别 很难达到一个ground truth 所以现在很厉害的模型厂商 比如Anthropic或者OpenAI 他们都会倾向于 去自建一个评测体系 来让它更接近他们心目中的分布 只不过第三方的验证

可以让他们对外发布的时候 更有说服力一些 当然比如说允中说的 一个垂直领域的肯定是非常重要的 因为这个就是面向一类群体 它这个分布就是那个群体 需要每天在做的事情 如果他能把那个分刷高了 比如金融 法律 他们律师每天做的事情 就能把那个做扎实了 那他们法律 只需要看这一个benchmark就足够了 第二点就是允中提到了 有些benchmark 它并不能代表真实的认知

比如说之前有一些benchmark 它是测agent智力的 就是玩那种小游戏 ARC Challenge(抽象推理挑战) 那种游戏 对 ARC-2 ARC-3这种 对 是 他这个benchmark的初衷是说 觉得能解这些游戏 是人类的一个智力的体现 但是没想到这个智力 其实也是可以做得特别特化 我一个小模型也能把它搞出来 还挺有意思 那有没有什么 特别niche的benchmark 但是可能大众不太了解

但其实是非常有用的 测试这个模型能力的例子 我可以举个我们的例子 我们有一些benchmark 可能不太经常出现在大家的榜单上 比如说我们前一阵子做的 Drug Discovery(药物发现) 还有一个 跟AI tutor(AI辅导)相关的 它可能关心的 是一个比较小的垂直领域 但是跟我和各个lab在交流 负责相关领域的团队 他们通常就会有这么一个人 他们会看市面上

跟他领域相关的评测 他都会把它收回来 另外一个就是说这个benchmark 最后上不上榜单 火不火 其实也有很多随机因素 比如说AA就有一个很好玩的事 AA用了我们做的一个榜单 叫SWE-Atlas 我们当时是做了几个 不同风味的SWE-Test 其中有Q&A 就是代码仓库问答 还有代码重构 还有写Test 只不过我们是分三个阶段推出的

所以Q&A先推出 推出之后 我们还没来得及把另外两个推出 把它们合在一起 Somehow 那个Q&A 就先被AA捡去了 Q&A上了AA之后 大家就开始刷这个东西 突然间就这一块需求就变大了 我们当时很不理解 Q&A是最简单的一个场景 就是我们花了那么多心血 做了更复杂的benchmark 结果就是因为可能是时间关系

还有的时候是某一个lab用了 可能是碰巧它的分好 这里面其实是有一些随机因素 就是你在这个榜单上 就大家tech report上看到的东西 有一定随机性 AA搜这些榜单有一些随机性 最后就是你没看到的东西 其实背后可能也有人在用 就这个生态其实水还比较深 还比较复杂一点 明白 一铀 其实我还想再问一下 就你刚才提到的 大家对于Artificial Analysis

这样榜单的质疑 你觉得说是不接近于 大家理想中的分布 这个分布现在有没有一个共识 因为我理解每个模型公司 对于分布的需求 其实也是不太一样的 是吧 如果是在这种情况下的话 我们怎么样去理解 这个理想状态下的分布 它是应该比较接近真实世界的 这样一些任务 还是说是别的分布 我觉得真实的分布

其实本质上就是大家的用户体验 就是世界上假设说存在这样一个 Ground truth 就真实的分布的真实的打分 其实有点类似于 LMArena 这种模式 假设说你每天 Prompt这个agent的时候 你能够有多条模型一直在执行 然后给它们打分 这是最真实的评价 但是这个现实生活中 能够做到这样的榜单 有以下几种因素

LMArena之前做好 是因为之前的QA它这个很快 它开销很低 你给它一个问题 它能够几秒钟之内给你个答案 你很快就能进行打分 但现在在agent的时代 一个长程任务动辄几个小时 一个用户也没有那么多的超能力 每次执行一个任务 都连着开几个agent一起去执行 也没有个机制去反馈 把它收集起来 所以说大家的评价 很多都是一个偏主观的

他很难拿到这样一个 真正的ground truth 但如果说有哪家公司或者有一家 有某种方式解决了这个问题 那肯定很厉害 但我相信他们大模型公司内部 肯定是有这样一个机制的 就是让他有几个版本的模型 然后有一些用户 他是真实用了这个东西 然后去测 我的意思是 假设有这样一个Distribution(分布) 然后你这个评测的分数的分布 接近于这个东西 那它就是一个很好的benchmark

对 我听到一些比较有意思的 很多评测benchmark 跟我线上做A/B test(A/B测试) 测出来结果是不一样的 就是用户的反馈跟评测 其实有时候不太一样 甚至很难说哪个好 因为用户有时候也比较主观 像这种聊天的 你可能给他特别多 这种factual(事实保真)的东西 相比给他很多这种 Clickbait(点击诱饵) 就说他爱听的话 可能这个结果也不一样

所以这块还是挺复杂 对 是这样的 就像Claude Code 我觉得在LMArena上 分数一直遥遥领先 就是因为我觉得Claude Code 它有个特点 就是尤其中文用户或者英文用户 它给出来的这个 Output format(输出格式) 更贴近于人们心目中想看到的 就非常好容易去理解 相反的是Codex 它可能执行得更细致一点 但是输出的东西 就没有人那么容易去 相对的没那么理解 所以说稍微吃了点亏 但我个人体验用户下来

他们俩可能是不相上下 其实我个人还更偏好于 OpenAI那边一点 因为它做得更细致 犯的错误更少 所以这个确实也是 很主观的一个事情 去怎么定义好这个distribution 所以在这种情况下 模型公司还会把benchmark 视为判断自己模型能力的 一个标准吗 他们肯定也是在乎外部的评价 不同模型公司 我是说先说美国那几家大的 他们肯定是倾向于自建为主 就是自家的evaluation团队

因为他们有这个能力去建 但是对于一些比如说刚成立的 或者相对没有那么有名气的 一些frontier labs(前沿实验室) 或者它不是头部的frontier labs 他们肯定是会非常依赖于 外部的评测 因为它内部的评测团队 可能没有那么有经验 或者那么完善 或者说他们的人力资源 更希望投入到模型的训练 和开发当中 而不是去直接利用 所以每个公司的策略 都不太一样 其实我的个人判断是说

当一个产品逐渐成熟之后 或者当你积累了 一定体量的用户之后 最后你其实关心的还是用户增长 比如说我之前其实做了很多年 在Meta做搜索跟推荐 逐渐地就变成了一个 类似搜索推荐的问题 就你看了什么样的指标 跟用户增长最相关 最后就朝着赚钱的方向走的 现在可能真正能够 评测到这个能力的lab不太多 需要一定的用户体量

可能在这个聊天的场景 就比较成熟了 但是在这些agent的场景上 能做到这个程度就更复杂一点 大模型可能跟传统搜推 不太一样的地方就在于说 它的场景很复杂 就算我能够在这个chat场景 做好很好的这个A/B test 甚至训这个reward model 来朝用户喜欢的方向发展 我总会有新的东西出来 而且大家一直在看新的东西 比如说现在大家都在卷科学发现 科学发现

我不可能有足够量的科学家 给我显著的A/B test的结果 必须还是要依靠场景 构造benchmark 我会说因为大家对这里的 应用场景的期待太高了 场景增长的速度 赶不上我在这个领域 用户沉淀的速度 还是有大量的需求 要依靠这个benchmark 来做评价标准 但我会觉得在某一些领域 沉淀下来之后 大家会有更多的线上评测体系

可能会像这种传统的互联网增长 看看哪些指标跟用户的 DAU(日活跃用户)增长更相关 对 能不能深入讲一下 数据采购这件事情 我觉得就是有几个点非常有意思 第一 你提到了刚才有很多小的公司 其实是现在一个创业机会 这也是为什么我们看到很多 最近兴起的一些四五个人 甚至两三个人的这些数据创业公司 拿到了非常高的估值

这是不是就是因为他们的目标 就是这些非常垂直的领域的数据 对 我觉得这里可能有几块问题 首先我觉得最近兴起的 这些RL environment公司 其实更多的是在做合成 因为整个数据行业 已经从找人标注 慢慢地过渡 你要交付的是一整套环境 然后这个环境可能需要大量的

这些工程工作在里面 很多在这些合成的技术栈上 做得比较好的一个小团队 其实可以比较短的时间 交付大量的合成环境 这未必是不好的 就合成它有时候你也可以 基于一些强的模型 或者说基于一些半成品的 这些artifact(产物) 是可以做出一些好东西来的 现在这里是一块增长 但是再往下走 这里面比较有意思的就是说 这个东西之所以能成立

因为大家今年的主题是在卷代码 软件行业是最奇怪的一个 就它非常的open 有大量的公开资料 而且我们生产数据的公司 同时大家都懂代码 所以就这个比较好解决 让一些小的团队有很多机会 给自己造很多数据 但是我觉得再往后面走 比如说这些其他领域的垂类 就更复杂了 这里面我会看到有一些公司 他们可能解决两个不同的问题

比如说像我们做后训练数据 其实在我看来是两个问题 第一是采购 就是我要把原材料买回来 就好像ALE让大家上传 这是一个比较新的激励机制 然后加工 加工就是我们再把它标注 或者是通过一些agent pipeline 把它做成适合大模型训练的环境 在这个垂直领域问题上 其实采购变得越来越复杂 就甚至代码领域 其实采购一些私域的代码仓库

谁能把这个问题解决好 其实就是一个巨大的优势 那么在垂直行业 比如说我如果是做芯片设计的 我可能要把整个芯片设计的环境 给造出来 可能当中涉及到一些商业软件 那我怎么样 把这些商业软件的版权拿到 把它包在这里面就是一个问题 还有一个就比如说 做DevOps(开发运维) 我要是一个系统工程师 我要操作什么AWS之类的 我知道有个公司 做了一整套AWS模拟器

每一个垂类的环境 都有一些很深的东西 你可能要采购 可能要定制软件 大家抓住一两个垂类 把这个东西做好 其实创造了很多新的机会 明白 因为刚才我们提到 这些垂直场景 比如说在 Drug Discovery(药物发现) 这些生物医药方面的 还有一些具体行业的评测下面 我们可能没有足够的场景 或者没有足够的好的评测 在这种情况下 我们有足够的好的数据吗

这里其实有一个难点 每个领域它都是需要一些人 把他的专业知识吐出来之外 我还需要这个领域的东西 像药物发现 我可能需要很多私有的数据库 就这里面我觉得是目前这个行业 一个大的卡点 就是你先要能把这东西买到 你知道大家手上有什么 才能把它做成benchmark ALE其实很大程度上 是在解决这个问题 对 ALE就是希望大家能够 以众包的方式

让专家把之前 自己做过的project交上来 当然这里面有一些不符合规范的 我们都筛掉了 因为他们甚至把一些 非常非常撕*的东西都交上来了 比如说什么法院的一些证据什么 就是非常 对 然后我们尽量把这个都筛掉了 比如说我们现在在V2中 我们也尝试去收一些数据 比如说Steam上的一个游戏库 就游戏开发的一个任务 它一个那种名不见经传的 大概几千人体量的一个

MOBA(多人在线战术竞技)类的游戏 它要价能要到两三百万人民币一条 我觉得哪家数据公司 或者别人做benchmark 都没有这个财力去做这个事情 就是这个游戏公司 会要价要到两三百万 对 要这个游戏的源码 对 就比如说很多公司想要 采一些游戏的视频 然后做些标注 游戏视频可能是版权数据 这里有一个巨大的采购问题 我觉得这里是一个商业机会

我现在其实看到不少startup 在解决这些问题 就其实大的数商 我们自己也在投入做一些 采购方面的工作 但是总体上来说 我觉得这里还有巨大的问题 没有被解决 有哪些现在非常热门的垂类 是数据非常少的 我会说至少医疗算一个 只是数据比较敏感 谁能拿到大量的病例数据 那就非常有优势

对 因为其实也有很多新闻讲到说 可能在法律或者金融的这些领域 会有一些之前离职的员工 可能会去分享他们的工作流 不过可能工作流数据 和像医疗数据里面这些病人的data 还是不太一样 是的 各个领域 我觉得甚至现在大家之所以都在说 金融 医疗 这些因为跟大家比较息息相关 大家多少还懂一点 其实这个世界上有很多 我都不知道的行业

就是你真的要跟他们聊才知道 就比如说我才知道 就做这个药物研发 大家还会交易这些分子 一个分子还能倒腾几套 这里面还要做 DD(Due Diligence 尽职调查) 所以可能没有做 只是因为大家不知道 对 就是我们在做ALE V2 想要把 比如说一个领域做深的时候 我们会尝试先捋一个领域 它会有哪些工作流 会有一个树状这样结构 尤其在生物学这一方面 然后我们基于

Nature publication(《自然》出版物) 它会有自然的分类 它对子学科分类 然后把这个树展开到第三级的时候 大概有3000个节点 然后我们也做了一下工作 就是把现在已有的市面上的life 和bio的benchmark 已经覆盖了多少 做了一个统计 大概是可能10% 5%都不到 甚至它连一个成型 覆盖面完全的一个benchmark 市面上都没有

更别说是针对这个去做相应的数据 明白 那像我们刚刚提到的 这些做合成数据的小公司 他们能赚钱的周期有多长呢 因为听起来好像都是 这几年新出现的这样一些公司 这些数据它的生命周期有多长呢 这是个好问题 至少现在需求还是挺大的 未来很难说 比如说这一波coding卷完了 他们需要新的品类

大家 你能不能抓住下一个机会 而且下一个机会 可能跟你现在的运行模式不太一样 比如说我自己会觉得采购会很重要 采购能力比较差的可能就比较难 或者就像一铀他们 你可能有些新的激励机制 让大家把东西交进来 对吧 所以可能以前的一个激励机制 是招聘平台 或者就给你一个小时工 但是以后可能有新的激励机制 就谁能把这些东西玩得转 可能会继续有一些优势

这个地方我想问允中你的看法 因为我个人认为 随着模型的能力越来越强 模型公司自己内部创造数据的能力 也越来越强 这一点你认为这个饼是越来越大的 但有没有可能会出现一个情况 这个饼面向于非头部公司的机会 反而是门槛是越来越高的 入场券是越来越难拿的 比如说数学这块领域 之前的话

大家只需要去影印那些奥数课本 就能够去批量造出大量的数据 但这些数据现在基本上是零价值 所以你是怎么看待这个趋势 就未来的数据公司的 这个发展方向 对 我会觉得从第一性原则上来说 还有巨量的问题没有解决 你要想这个世界上 还有多少东西没被蒸馏干净 是巨大的机会 但是如果你就看 现在大家是怎么运行的

这个事情当然会越来越难 因为越来越多的这个玩家进来了 我觉得大家如果只盯着 我手上的工作 这个一定是越来越难做的 就算这个lab不自己做 越来越多的竞争对手进来 你的margin(利润率) 也会越来越低 所以在我看来 一个好的数商其实最后解决的 是个研发问题了 就好像一个软件公司一样 我要提前投入未来大家需要的东西 赚到钱之后我再投入下一个东西

在lab本身 我有个暴论 可能lab未必有最好的基因 来解决数据的问题 这里面可能有几块 比如说合成数据 合成数据其实按理说 很多就是这个lab research的 本职工作了 尤其是搞后训练的 大部分时间都花在搞数据上了 就是买数据 核数据 验证数据 洗数据 但是这个领域你会觉得

为什么外面的人会有机会 今年的这一波增长 都来自于一些懂行的人 在外面把这个数据合了再卖回去 所以这个事情是存在的 我觉得一方面 是因为大模型公司现在有太多的钱 就是你自己造 外面买其实也不矛盾 但是在更长远上来说 其实有很多问题 可能模型公司没有太好的基因解决 比如说 如果我要采购

我要把一些行业的东西先采购回来 蒸馏出来 这个时候我会觉得大的lab 可能未必有那么大的优势 它甚至可能会有一些 Conflict of interest(利益冲突) 比如说一方面 把你的这个FDE(前线部署工程师) 派到了人家企业里面 然后另一方面你有一拨人 在搞这个企业数据 那么我会觉得如果我是一个企业 我是不太放心把我的数据交给你的 出于这些原因 有一些东西可能lab不太适合自己做

它可能还是需要第三方的这个人 帮他做一些采购 或者深入到一些行业领域里面去 我会觉得一个数商真正要做的事情 是在研发 看看未来还有哪些行业是重要的 这些行业有哪些东西我要值得投入 把东西买回来 然后我自己先投入R&D(研发) 把这个行业的问题给研究清楚 然后再把它做成benchmark 或者数据 甚至证明这个东西的有效性 然后我再转手卖给lab

从lab来说 就是大家的 Deadline(截止日期)都很死 如果我是一个lab的research 如果你让我花半年的时间 来解决一个行业 可能有时候大家其实没有自由度 就是这个时候你看到 那边有一个数商说 我把那个行业的东西搞清楚了 你要不要 大家通常都会看一眼 所以我觉得其实长期来说 拼的还是一个研发能力 你觉得这个趋势 对于大模型公司来说会持续吗

因为现在模型公司里面 也有自己的数据团队 但是你觉得他们更愿意 去从第三方那里收数据 而不是自己去造环境 造数据 这里我觉得可能不矛盾 因为最后模型公司最高的优先级 还是把东西做好 如果他们自己能生产好的数据的话 有可能会倾向于自己生产 只是现在大方向上来看 这个世界上还有太多的工作流

没有被折腾清楚的 那么对外部数商的依赖 我觉得是长期存在的 甚至就是一个大模型实验室 自己可能未必 想要投入那么多的资源 做得这么重 可能更prefer灵活一点 缺点就是说大家可能希望 更多的东西是第一方的 不希望所有人 都能从数商中获得这些能力 所以就从这个角度来看 会有一定的动机自己研发 就比如说现在可能很多labs 它在做这个

Expert matching(专家匹配) 就是说你把人派到我这里来 就也有这么一些趋势 我自己也会觉得说 现在有太多东西没有被解决了 不管是谁把这些问题解决了 那他一定是有赚钱的机会 这个东西可能跟在哪里发生 不是很有所谓 现在是机会多 饼在越变越大的这么一个阶段 但这也是大家对于数据 一直有的一个问题 也就是说如果一个第三方供应商

把同样的数据卖给不同的模型公司 那它中间怎么样去区分呢 这里通常来说 有个比较简单的解决方案 就是说你可以花多点钱 把这个数据买断 你觉得对于模型公司来说 在数据供应商 收到那么多数据的情况下 他们怎么样去使用这些数据 这个流程能不能给我们讲一下 就这里面一般来说

它是有一些比较固定的训练方式的 我们把它叫 Training recipe(训练配方) 就比如说像是比较简单的这种数据 我可能就是直接SFT(监督微调) 就是我把对的答案给它就行了 然后像是rubric这一种 它可能就是在做强化学习 因为就是不停地 有一个模型在给它打分 比较有意思的是现在这些RL环境 比如说最近大家在卷的 一些特别长程的任务

现在今年的一个主题 是RSI(递归自我改进) 就是recursive self improvement 它其实是个buzzword(热词) 就是说AI自己研发自己 那大家最近就在看那些 我跑一把可能要跑个几天 一个星期 其中你可能要有个GPU 真的在上面模型训模型的任务 这里的训练方式 其实就开始变得有一些模糊了 我们也在一起研究 这里面的训练方式要怎么搞

但是我自己就觉得 这里面其实还没有太多的共识 所以还有很多有意思的空间 就对于数商来说 有时候也不完全是 造一个模拟的task这么简单 你还要考虑到他 模型公司拿去要怎么训 针对他怎么训 可能还要有一些定制 对 这一块我也比较好奇 如果说你就是为了bench-maxxing 就是你拿ALE的一些任务 你直接去训练 就类似做一批这样的数据

那你怎么保证这个数据它训练出来 它模型能力 泛化能力能够提升 能够被迁移到其他的任务上去 这个东西有没有一些比较系统化 科学化的方法来做这样的验证呢 如何在不训一个模型基础上 能够评判这个数据 能给模型带来怎样的提升 对 我觉得这里其实有一些技术 比如说现在如果我要造一个环境 大家最怕的就是

Reward hacking(奖励作弊) 就它有捷径 如果明明我没有完成这个task 我可能是使了一些手脚 结果我的分可以打得很高 就是我训出来这个模型 肯定会变成一个耍滑头模型 这种东西肯定是不希望发生的 那么通常来说我会有一些技术 我可以用agent 来做red team(对抗性测试) 之后我会让一些比较强的模型 来试试看

能不能在这个task里面找到捷径 另外就是这里面很多 是我自己的个人猜想 不代表Scale AI或者任何客户 就是说在训练这些东西的时候 很多benchmark 我们可能只关心 最后有没有完成这个任务 就是我们的验证器 是围绕这些东西设计的 但是我怎么样完成它 这些东西可能也会在模型训练里面 有一些关键作用 一个比较trivial(琐碎)的例子 就是说budget(预算)

就比如说我训模型的时候 我会关心它是不是 消耗了过多的token 或者用了这些步数 那么我们在训练它 比如说在拿ALE的模型数据 训练的时候 肯定我最后reward会很复杂 不是说我把这东西解出来就行了 我可能还关注它消耗了多少资源 最后可能是在各种各样维度的 检查 reward 防止它作弊 这些东西结合起来 才能完成一个训练的recipe

其实就感觉也没那么简单 这些可能是训练数据 更多要考虑的问题 就是说我这些数据 能不能导出一个比较好的训练方式 能不能讲一下像RSI 或者因为刚才 我们也提到很多Neo Lab 像在这些情况下 做这些训练需要的数据 有什么不一样吗 或者需要的定制有什么不一样吗 通常来说 最常见的定制其实是难度 大家做benchmark的时候

一般来说至少希望它不那么饱和 那就意味着越难越好 但也不一定 就像一铀说的 也不要就完全解不出来 就是benchmark的难度 更多的是一个 客观地反映我这个行业难度的事情 但是在我训模型的时候 需要做一个特化就是说 这个难度对它的模型要适中 我们有时候会做这个事情 模型厂商会把它 甚至还没有发布的模型给我们

然后我们帮它筛数据 这个题目对它来说不能太难 也不能太简单 因为现在做这个强化学习是说 让模型在上面自己试 如果试对了的话 它就能学到一些东西 那我给它题太难了 它啥也做不出来 肯定就不行 所以在这个难度上会做一些适配 然后另外可能我们会做一些 轨迹采集 就比如说 如果你把你的模型的轨迹给我们 我们可能把这些轨迹采集出来

然后帮你做一些筛选 甚至我们想办法用人 给你搞一些可以解这些问题的轨迹 这样你可以拿回去 不需要做强化学习 你可以直接照着这个轨迹 做SFT(监督微调) 针对它的训练需求 其实也有一些特化的这种工作 好 接下来还想再聊一下 数据污染的这个问题 因为今年2月的时候 OpenAI就宣布停止报告它在

SWE-bench Verified里面的分数 这个其实也是一套评测 具体来说 就是让AI修复 真实开源软件里面的项目问题 再通过这个测试来判断 它有没有修好 当时 OpenAI主要是指出了两类问题 一类是它测试本身可能会有缺陷 比如说有的功能上 正确的解法也会被判错 另一类就是数据污染 这个我觉得很有意思

他们发现是在特定提示下面 模型能够复现部分题目原本的 人类修复代码 也就是说 模型很可能在训练过程当中 就已经接触过相关内容了 所以这个分数就变得有点难解释了 我想问一下两位 是怎么理解数据污染这个问题的呢 就SWE-bench这一类数据 其实有一个问题 它可能甚至还不是污染

就是它task可能就做得不够好 比如说有时候有一些错误是假错误 比如说可能我的测试脚本 要求得太多了 或者是我的task没讲清楚 有这么一些类型的原因 另外一个污染可能是说 模型预训练的时候 把这些东西都训练进去了 这里面其实是有一些技术 可以检测到这些东西

我想这ALE上面 应该会有一些这种经验 要不然他说不采用SWE-bench 是连SWE-bench Verified 也不采用 就是当一个benchmark它 我印象中它是在过去的6个月内 只从74%提升到了80% 剩下那些问题 可能是脚本写得太严苛了 或者它的题目本身就是不可解 或者是会有各种各样的问题 它剩下的可能20% 都是集中在这个问题上

那这个benchmark 本身可能就失去了它对比的意义 ALE也没有解决一个问题 这个也想跟允中探讨一下 当一个专家他本身提交上来的材料 本身是错的时候 我该如何去预防这个问题 这个是我们真实发生过的 因为我们专家五花八门的 当然这样的人很少 他是为了提交这个任务 为了拿到作者(署名) 因为我们的奖励机制 就是你提交了这个东西

我们接纳了你这个任务 你就能被纳为作者列表的一部分 确实是有人为了提交而提交 他甚至起了agent 去合成一堆乱七八糟的数据 甚至有些数据交上来 我就肉眼看出来他就是编的 这个东西是确实是对我们的工作 造成了很大的困扰 这是个特别大的问题 Scale AI总是有人 总是可以靠人解决的 这里有个特别有意思的问题 比如说一铀提到了

我给他这个authorship(署名权) 是一种奖励机制 那会带来一定的问题 比如说就Scale AI 那更原始的 比如说我就给你小时工 那大家也有一些偷懒作弊的方案 我会觉得这个奖励机制 是个特别特别难的问题 长远来说 比如说我的目标是把人类 都蒸馏干净 对吧 怎么样设计一个好的奖励机制 把大家的目标都align(协调一致) 我觉得这里其实有特别大的空间

这里可能是个巨大的 Research area(研究领域) 我自己心中可能有一些方案 Proof of work(工作量证明) 就比如说我要求你把做这个东西的 一整段工作流程全部都录下来 你必须要做到多少时长 或者怎么样 不同形式的问题 它有不同形式的奖励和验证机制 这里面其实有很多玩法 值得大家探索 这里面其实也涉及到一个更大的问题 就是很多数据 它本来也就是公开数据

就是网上的一些资料 公开代码 这些东西 所以这些数据是不是本身就注定了 会有污染 一般是怎么样处理这些情况 其实最简单的污染 你直接其实问agent 它都能找到 公开数据其实还好检测 我觉得最难的是编造数据 比如说让你去做一个化学模拟 就它根本就没有跑过这个任务 它自己编了一套似是而非的东西 你没有个几个月 根本查不出来这个问题

因为它看上去很真 什么时候能发现这个问题 当所有的agent 它的能力 基本上远超这个问题本身的时候 他发现所有的答案 他们都是做出来是一样的 但是跟这个真实答案是不一致的 这个时候 我们就会查出问题 但这个周期会非常长 然后你让另外一个专家 去验证这个问题 它成本又非常非常高 因为它本身这个问题 它都是要专家花一个多礼拜 或者两个礼拜才能做出来 对 然后那个验证的专家 你要保证他

对 验证的专家 他本身也会为了一些东西 偷奸耍滑说这个东西它就是对的 所以每个涉及到专家评测 都会有这个问题吗 对 都会有 众包的benchmark为什么难做 就是难做在这里 人性是非常复杂的 是 我觉得这里 他可能甚至验证是一环 我自己觉得确实在奖励机制上 比如说 如果你就让他在那 老老实实待着做12个小时 对吧 你给我合假数据

你也要把每一步都给我交出来 要求你必须做这么多的动作 那他可能就没有那么大的动机 给你合假数据了 这些是比较值得研究的方向 很有意思 其实我本来是想问一下 真实工作流的数据 但是听下来大家现在还是在卷 Coding数据 是吗 不是在做真的workflow(工作流) 因为我理解是 比如说像Mercor这样的公司 就是有在卖一些 真的workflow的数据

但是听起来coding 现在还是这个赛道最卷的 其实你怎么定义真实工作流的数据 就真实工作流的数据 本质上它都能够被划归到 一个coding的问题 就比如说对3D建模这个问题 其实有很多 比如说FreeCAD什么 它都是提供了现成的API 让你去做这个事情的 就是这不是传统意义上的coding 就是让你去写一段代码 去解一个LeetCode这种coding题 它是用coding 去解决真实workflow

所以说只要有足够的 MCP API调用 它其实本质上95%以上的 任务都能够被划归到 Coding的问题上来 对 就是可能有一些小的 可以看它这个task本身 是要的什么东西 它涉及到的一些环节是什么 能把它归结到 不同领域的工作流上去 但是就我同意一铀说的 现在 因为你让agent来做事情 代码就是它的手跟脚

所以它其实归根结底 Coding肯定是其中的一环 明白 你们觉得在私有数据 需求依然很大的情况下 未来的数据公司 会不会从卷采购本身变成卷并购 就是去收购一些垂直领域的公司 对 不评论Scale AI 我是听说有一块很大的 Private equity business(PE业务) 就是说以前大家是flip公司

现在flip公司的一个新的方式 就是说我买了这个公司 我用AI让它提效 把一些人裁了 之后把这个公司的价值做上去 再把它卖了 现在就多了一层 就是除了我买这个公司 可以把它重组打包 用AI提效之外 我还能把它的数据发掘出来 就它数据还能卖一些钱 所以就是让这些 整个买公司的行业又多了一个玩法

就很自然地大家 就是数商 或者就传统做 Private equity(私募股权)的公司 也在看这个数据怎么能够卖钱 然后就兴起了一整个领域 我甚至觉得说 如果真的未来 比如说5年 10年 还是这个速度发展 大家还没有遇到瓶颈的话 把各个行业的东西都给拿出来 可能这个东西跟大模型本身 就是世界上最大的两个行业 当然这是比较极端的

AI doomist view(AI末日论观点) 可能会导出这么一个世界 是的 但是听起来 其实数据行业本身 也是在变化得非常快 因为就像我们刚才提到 从这个rubric data 到RL环境的这样一个变化 所以有什么信号 会让你觉得有某一个领域 或者某一个赛道 它可以持续地增长吗 我会觉得就首先 还有很多没有解决的问题 机会还是很多的 另外一方面有越来越多的

玩家进来了 比如说每年都有很多新的Neo Lab 资本市场还是以这个方式运作的话 就这个饼是越来越大的 但是这个数据变化很快 不太像是一个 我可以躺在一个地方 一直吃老本的生意 数商要疯狂地迭代自己 最后可能是拼大家的R&D的能力 或者说谁能把 这个R&D的能力本身固化 做成一个flywheel(飞轮) 我有一个流水线

可以一直在发掘新的东西 也许这个是未来最大的优势 但是就总体上来说 我会觉得现在是百花齐放 未来机会还很多 这我也是从一些地方听说 数商的估值空间 一般没有传统的公司来得大 就是因为它很难把这个杠杆保持住 然后让你以很轻松的方式 在一个积累的用户量情况下 就能躺在那里吃老本挣钱 就像Facebook Google的 一些生物一样

它已经有积累大量用户 它就能躺在这些APP上赚钱 但数字生意 领导者必须持续地去思考 下一步在哪里 持续去迭代 因为模型迭代速度太恐怖了 你觉得你们现在在做ALE 2.0的时候 最难的是什么 我觉得学术上相对容易一些的 比他们Scale AI 在做商业上 因为他们给我们的数据 很多都是无偿的 但是我能够想象得出 我如果是一家数商 要去收这个数据

这些都是天文数字 就那些收上来的原始的项目和代码 而且很难找到一个很好的奖励机制 让这些专家 能够自愿地把这个交上来 我拿Mercor他们官网上的 给专家的一个小时的价格来算 比如说制造业的工程师 大概是可能一两百刀一个小时 这种价格就限定了 它不可能招到特别特别高级的工程师 但是为什么学术界好做

因为我们能够自然而然地 吸引到一些这种级别的人 来帮我们收集数据 因为他们不求钱 他们图的是 大家一起把这个事情做好 图的是个名 所以说这个奖励制度不一样 就导致你能吸引到的人不一样 你的上游是不一样的 OK 很有意思 好 那我们就到这里结束吧 谢谢允中 谢谢一铀 参加我们的节目 谢谢Yiwen 谢谢 好 以上就是我们这期播客的

全部内容了 国内的听众可以通过小宇宙 苹果播客 网易云音乐 喜马拉雅 QQ音乐 蜻蜓FM 荔枝FM来关注我们 海外的听众 可以通过苹果播客和Spotify 或者在YouTube上 搜索《硅谷101》播客来关注我们 我们部分的文字稿 还会收录在《硅谷101》的 微信公众号上

谢谢大家 我们下次再见

Loading...

Loading video analysis...