1 缘起
早上黎老师发给我教育技术学自留地的文章,见识了全新的理念:Paper2Agent。
用多智能体系统自动分析论文及其代码库,将核心方法封装为经过自动化测试的 MCP(Model Context Protocol)服务器,再将其接入 Claude Code 等对话式 AI,使论文变成一位“虚拟通讯作者”(virtual corresponding author)——它能解释方法、复现已发表的分析、将方法迁移到用户自己的新数据,甚至与来自其他论文的 Agent 协作生成新见解。
简单地说,就是某个论文的流程和方法可以借助AI变成其他人可以复用的流程和方法,服务相似的任务。
于是我想起了跟早时期做过的实验:Paper2Skill。
2 Paper2Skill
9月20日刘润发的文章,讲功德交易系统,人的信仰可以花钱得以被确认,于是莫高窟不断长出洞穴、雕像、壁画。
这是一套系统,供养人出钱,工匠(供应商)负责开窟、塑像、画壁画,僧侣提供信仰。刘润让我们看清了底层逻辑:信仰负责点燃人们的愿望,而商业机制让愿望能够落地并持续运转。商业的本质不是赚钱,而是让价值能够交换,让系统能够代谢。
不止看见“发生了什么”,而是追问“为什么它能成立”,这就是专家的能力。
于是我让WorkBuddy提炼Skill。
确实看到了我关切的2个例子,分析了内生课堂和个人知识分享平台。
这个技能带给育才中学内生课堂的启示——最该补的一环:多数课堂改革只点燃愿望(理念),没有交换阶梯与沉淀物,于是三年后热度消散。把「一生一档」做成可展示的沉淀,是让内生课堂活过十年的关键。
这个技能带给知识分享的启示——自检点:如果只有免费文章而没有沉淀库,交换就停在「注意力换情绪」,留不下资产。把每篇思考结构化入库——可视化、建体系、开发Skill、出书——才是真正的开窟。你是一名系统设计师。请用「信仰交换体系六步法」分析我给出的项目。长期存在的系统 = 愿望(意义侧) × 交换(资源侧) × 沉淀(资产侧)。S1 愿望:用户(区分使用者/决策者/出资者)最具体、可验收的 3 个愿望;S2 供养人:真正付出资源的人是谁,付出了什么(钱/时间/注意力/社交资本);S3 意义系统:该项目用什么语言定义「值得」,有什么可重复的仪式;S4 交换阶梯:按普惠入口 / 身份可视 / 旗舰资产 / 顶配命名权 四档,各设计一项具体交换物,S5 交付产能:交付 SOP 与验收标准,指出订单翻十倍时最先断裂的一环;S6 沉淀资产:十年后留下什么看得见的东西,它如何反哺吸引新愿望;最后给出 3 条最紧急的补强建议,并用 10 分制评估该系统的「代谢健康度」。输出用表格 + 要点,不要空话。我的项目是:【在此填写】我让WorkBuddy在Skill的基础上生成了Agent,一个基于“四角色三原则六步法”的诊断系统。结果如下图:
4 Paper2Skill与Paper2Agent的比较
两者确实像,但差在一层地基上。
维度 | Paper2Skill | Paper2Agent |
本质 | 知识封装为技能 | 技能封装为智能体 |
构成 | 文档 + 规则 + 模板 + 清单 | Skill 调用 + 代码 + 状态 + 测试 |
输入输出 | 人给材料 → 出一个技能 | 人给材料 → 出完整业务成果 |
失败模式 | 产出平庸、跑偏题意——代价低 | 自信地做错事、调用工具——代价高 |
可验证性 | 靠人读一遍 | 可自动化测试 |
迁移成本 | 极低 | 略高,要数据、要接口 |
哪个更靠谱?看你的产出物可不可验证。
Paper2Agent 自己已经给出答案:74% 的成功率。关键句是——“Agent 不能凭空补齐从未公开的科研资产。”能 Agent 化的前提,是论文把代码、数据、环境全公开了;剩下 26% 的失败,基本都栽在这里。论文、报告、分析、方案类任务 → Skill 更靠谱。 产出是给人读的,判定标准模糊,Agent 自主执行反而增加不可控性。我上次做的“信仰交换体系”,本质就是把一篇文章压缩成一套判断框架——这类活儿,Skill 完胜。数据处理、批量操作、可验证流程 → Agent 更靠谱。 只要存在明确验收标准——测试通过、计数一致、格式合规——Agent 就能靠自动化测试建立信用。“内生课堂”积分统计,就是典型的可 Agent 化场景。最靠谱的形态是叠加:Skill 定“怎么判断”,Agent 干“怎么执行”。 Paper2Agent 的 MCP 服务器里装的,正是一套被代码固化的方法 Skill。① 先判“可验证性”,再决定封装形态。问三个问题:有明确验收标准吗?输入输出格式稳定吗?失败了能回滚吗?三个都是“是”→ 做 Agent;有一个“否”→ 先做 Skill。② Skill 是 Agent 的“规则”。不要一开始就写 Agent。先用 Skill 把判断标准、边界条件、典型反例写清楚,跑几轮人工验证,确认方法本身站得住,再把它固化成 Agent 的工具逻辑。没有 Skill 沉淀的 Agent,或许是在放大你的模糊。③ 给人留一道“不可委托”的闸门。Paper2Agent 作者自己的态度最务实:把论文 Agent 当作能力放大器与假设生成器,而把证据判断与科学责任牢牢留在人的手里。凡是不可逆的动作——发布、付款、对外发送、写入数据库——Agent 只能提议,人必须确认。④ 用测试当信用底座,而不是用感受。Agent 的可靠性不来自“它说得很有道理”,来自每次运行都能自动验一遍。你现在做积分统计的交叉比对,就是这个思路。给每个 Agent 配一个“自检脚本”——对不上就报错。⑤ 分层交付,允许降级。高风险的判断用 Skill,人读;高频重复的执行用 Agent,机跑。Paper2Skill 与 Paper2Agent,都是人机协同的新策略。