当题库追不上模型,AI开始给自己出题:中国这支团队跑通了数据层RSI
AI参与创造下一代AI
本条来自 量子位(AI / 中文),聚焦 technology、ai。 硅谷今年最贵的词,叫 Recursive Self-Improving 。
AI参与创造下一代AI
- 看得出来,这些顶级AI研究者正在形成一个共识:
- 模型越强,能给AI出题、解题、验证的人越少,高质量训练数据该从哪来?
- BigBang没有去猜坐标,而是利用转座子与染色体之间的连接证据做约束映射:
- 100%纯AI合成的训练数据,为什么能有这样的表现?
- 硅谷今年最贵的词,叫 Recursive Self-Improving
AI参与创造下一代AI
硅谷今年最贵的词,叫 Recursive Self-Improving 。
它就是指让AI参与迭代自身的模型、算法、数据和研发流程。
Jeff Dean 离职创办的Discovery Loop,方向就是探索AI自动化科学研究。
不只姐夫,AlphaGo缔造者 David Silver 等一众大牛也在同一条赛道上。
看得出来,这些顶级AI研究者正在形成一个共识:
让AI参与创造下一代AI,让AI持续自我改进并构建更强的AI 。
模型越强,能给AI出题、解题、验证的人越少,高质量训练数据该从哪来?
由 上海交大人工智能学院、深势科技、上海算法创新研究院 组成的 无尽前沿团队 发布 BigBang-V1 ——
这是首个基于recursive self-improving原生方式训练出的基座模型。
在训练过程中,出题、解题、验证都交给AI把控,通过可验证前沿任务持续生成高质量自演进合成数据,全程无需人类逐题参与。
BigBang-V1参数规模35B,推理时激活约3B参数,支持262K长上下文。
它的 后训练数据100%由AI自主合成,以科学前沿任务为核心 。
在这样的条件下,模型在长程搜索、代码、科学研究、AI研究等评测中, 拿下全部35B模型里的10项第一 。
不仅如此,在FrontierScience Research、PaperBench等多项高难度科研任务上,成绩甚至超过了1T级的DeepSeek V4 Pro Preview。
基准分数之外,具体任务里的表现更能说明BigBang-V1解决复杂问题的水平。
转座子定位 要求在全基因组测序数据里定位一个47bp的转座子插入位点,模型不仅要识别相关序列,还得遵守RefSeq染色体命名和1-based坐标约定。
BigBang没有去猜坐标,而是利用转座子与染色体之间的连接证据做约束映射:
一个junction对应一个坐标,最终把断点锁定在4144431,每一步证据都可追溯。
在论文复现任务里,BigBang的表现又像一个会自我纠错的工程师。
任务要求 把LBCS论文复现为可运行的代码仓库 ,它在通读完论文之后没有急着交卷,而是在冒烟测试里发现自己写出的实现违反了论文的核心主张:
它推算了扰动规模,发现无法越过触发阈值,于是连续否决了三个候选修复方案,最终把连续扰动改成二进制掩码翻转,问题才真正解决。
第二轮它又发现一个梯度项从计算图中脱离,主动恢复了梯度流,最终复现评分0.7657,全部485个评分点通过331个。
BigBang真正展现出的是 把多步证据组织成可验证结论 的能力,以及 在失败中发现问题、修正方案 的本事。
毕竟,科研不是背答案,而是从噪声里找证据,在出错时改方案。
不过,以科研任务为核心构建的数据,并没有把BigBang-V1训练成只会答科学题的垂直模型。
BrowseComp基准达到76.5,SWE-Bench Pro拿到54.2,能力增益同时迁移到了长程搜索、软件工程、代码等场景。
让它盘点8月第一周AI圈的大事。它一天一天连着检索了二十多轮、翻了十几个来源。
先用定位候选事件,再逐条打开信源交叉验证,最后还专门找到一手页面核对细节,连发布日期都逐个确认才给出结论。
代码写得非常丝滑,打中后爆炸产生粒子特效,左上角还展示了分数、生命、等级游戏UI。
100%纯AI合成的训练数据,为什么能有这样的表现?
Recursive Self-Improving火热,业界也都在谈论,但大多数探索还仅仅徘徊在概念层,真正跑通完整闭环的落地案例并不多。
一部分方案只是给模型套上一层工具外壳,比如harness,让模型自己调调工具、改改提示词。
但这样相当于只是把模型的调用方式做了增强,底层的训练管线几乎原封不动,并没有触动模型自我迭代的根源。
还有一类做法则是用大模型对生成的数据做打分筛选。
但这套评判标准是人类预先写死的规则,筛选逻辑本身不会跟着模型能力成长而自我演化。
模型变强之后,旧的评判标尺很快就会失效,依然源源不断产出低价值样本。
单纯靠扩大数据集规模、对已有数据反复清洗过滤,已经很难再撬动能力的进一步跃升。
训练数据仍由人类逐题生产, 模型的进化速度被人类出题的速度卡住 ,这是Recursive Self-Improving落地的核心问题之一。
BigBang团队换了一个角度思考这个问题。
如果模型可以自我改进,那么能不能让训练数据的生产系统本身,也成为被优化的对象?
本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。
· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology、ai。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「当题库追不上模型,AI开始给自己出题:中国这支团队跑通了数据层RSI」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
它就是指让AI参与迭代自身的模型、算法、数据和研发流程。…