← 返回研究

从“会做”到“能证明做到了”:Singularity 的 Minecraft 自主智能体能力演化

Singularity 将开放世界智能体的计划、执行、观测与能力主张拆分治理,通过真实 Paper 世界、动作后验证和独立资格审计衡量自主能力。当前 M0–M4 已获得证据支持,14 项固定基准全部达到重复验证,M5–M7 仍保持未完成状态。

从“会做”到“能证明做到了”:Singularity 的 Minecraft 自主智能体能力演化

在开放世界智能体中,可靠性是一套关于“何时可以相信自己”的系统设计。

大型语言模型已经能够为开放世界任务提出看似合理的计划,但一条漂亮的执行轨迹并不能回答三个关键问题:动作是否真实发生,结果是否由智能体自身造成,同一种能力能否在独立运行中再次出现。

Singularity 的研究重点不是扩大演示范围,而是把这些问题编码进运行时和评估协议,将自主智能体从“功能演示”推进为可审计的能力工程。

截至 2026 年 7 月 29 日的权威证据快照,8 个里程碑中有 5 个获得证据支持。M1、M2 与 M4 共 14 项固定基准任务全部达到 repeat_verified,M3 通过 3 次后续技能学习会话和留出集迁移门禁;系统整体仍被标记为 incomplete

演示成功不等于能力成立

Singularity 使用一条由弱到强的证据阶梯约束能力主张:源码存在只能证明系统可被检查;离线测试证明软件按预期工作;真实运行证明环境中确实发生了变化;只有独立重复门禁,才能证明一种能力可以复现。

系统因此从一开始就规定什么证据足以支持主张,再让运行时主动生产这些证据。身份漂移、协议漂移、日志哈希不匹配、世界重置不完整或运行超时,都会让一次结果失去资格,而不是被解释为“基本成功”。

认知循环与证据循环同时闭合

Singularity 的 Python 认知核心负责感知、规划、任务、记忆、技能和反思;Node.js Mineflayer 桥接层负责寻路、背包操作、合成、放置与环境观测。二者之间使用受类型契约约束的动作通道,而不是让模型用自由文本直接控制环境。

计划可以保留弹性,但动作参数与后置条件必须精确。每次动作都会记录前态、参数、后态以及被接受或拒绝的原因。导航需要满足最终距离阈值;挖掘需要同时观察目标方块消失和有界拾取证据;合成则必须以背包前后差量为依据,而不是相信规划器给出的成功声明。

每个可计数运行从 preflight 开始,随后执行固定世界重置、会话记录、结果汇总和独立资格检查。观测、计划、动作、验证与任务状态被写入 JSONL,最终证据包还包含协议身份、时限与 SHA-256。只有通过资格审计的独立运行才会进入能力账本。

M1–M4:能力如何逐级形成

M1 建立了最小的动作闭环。五项任务覆盖采集原木、制作工作台、制作木镐、开采圆石和制作石镐,共取得 15/15 个独立合格成功。结果同时显示,开采圆石需要最多重试,说明导航、工具状态和方块变化验证比一次合成更加敏感。

M2 引入真实 LLM 任务规划,但没有降低执行标准。Root Plan、继续规划和失败恢复都必须生成类型化动作,并在固定世界、固定模型请求契约与绝对时限内完成。BM-006 与 BM-007 采用技能关闭/开启的配对评估:三个独立世界中的 3/3 配对全部通过,且候选臂必须记录技能选择、成功动作和高置信度归因。由此,“启用技能后也成功”才不会被误写成“成功由技能导致”。

M3 研究技能库与长期记忆。三次可计数会话都完成一次技能检索、一次结果写回和一个目标;由两个互斥支持会话组成的留出集门禁取得 1.0 的平均泛化增益,并允许候选技能晋级。此前 37 次会话形成的失败报告没有被删除,而是作为被新证据超越的历史状态保留,避免成功结果掩盖记忆污染、错误归因和过拟合过程。

M4 把系统推进到跨夜生存、获取铁资源、熔炼铁锭和制作铁镐等更长任务链。BM-011 至 BM-014 全部达到三次重复验证。在 81 次记录中,仅 13 次被计为合格成功,另有 64 次失败和 4 次未计入结果。严格门禁增加了工程成本,却显著降低了把偶然成功包装成能力的风险。

一条铁镐科技链如何被机器证明

在 BM-014 的一个合格运行中,智能体依次收集木材、制作工作台与木镐、开采圆石、制作石镐、获取原铁与煤、制作和放置熔炉、熔炼铁锭,最后补齐木棍并制作铁镐。

该运行以 46 个自主循环、46 个动作完成 11 个目标,并通过 74/74 项独立检查。它不是最短路径证明,而是一条端到端可审计链:材料必须来自本次 episode,工具、方块和熔炼结果都必须具备机器状态差量;任何一步没有闭合,后续任务都不能被验证器判定为完成。

M4 的合格运行还显示了任务本身的时间结构。生存至次日黎明平均需要约 698 秒,主要受自然昼夜推进约束;获取铁资源、熔炼铁锭与制作铁镐的平均耗时分别约为 345.9 秒、255.7 秒和 273.1 秒。由于目标与时限不同,这些数字用于说明收敛过程,而不用于跨任务能力排名。

失败是能力演化的数据集

Singularity 没有把失败移到附录。BM-012 记录了 43 次失败,BM-014 记录了 6 次失败,它们暴露出规划文本之外的真实工程问题:动作参数别名不规范、不同木板种类的前置条件匹配、消耗动作后的背包刷新滞后、放置候选不可靠,以及模型提供商和文件系统生命周期故障。

对应修复主要发生在契约、观测、归因和资格层。例如,物品家族被写入类型化契约;合成后的任务绑定与权威背包刷新被拆开;放置动作要求同一机器快照中同时存在实心参考方块和可替换目标方块;HTTP 超时、零字节响应、TLS 错误或只读文件系统则被明确记录为 provider 或 lifecycle failure,不能由规则规划器静默接管后继续计分。

这些经验指向一个朴素结论:让规划器说得更像正确答案,只会产生更漂亮的日志;真正可扩展的可靠性来自更严格的系统边界。

已验证部分与尚未完成部分

当前可以公开支持的结论范围是 M0–M4:研究基线、原子动作、LLM 任务规划、技能学习与长期记忆,以及自主生存均已获得相应等级的证据。

M5 之后虽然存在局部 machine_verified 记录,但活动级独立审计仍为 passed=falsecompletion_claim_allowed=false,因此不能声明开放世界探索已经完成。M6 尚缺少截图支持的合格真实运行与匹配消融;M7 的多智能体基准 BM-701 尚无可计数真实运行。

下一阶段将使用官方场景矩阵、独立世界种子和恢复证据闭合 M5;为 M6 采集带截图的真实运行并完成视觉动作消融;为 M7 运行角色隔离的多智能体任务,并与单智能体基线比较完成率与效率。

Singularity 当前最重要的成果,不只是完成 14 项 Minecraft 基准任务,而是建立了一条能够抵抗自我欺骗的能力生产线:计划、动作、观测、验证与能力主张被拆开治理,使成功可以复现、失败可以定位,尚未完成的边界也可以被诚实公开。