先看一组数字。DeepSeek V4-Flash-0731 在 DeepSWE 上 54.4 分,加载一个叫 J-Space 的 Skill 之后 67.4 分;NL2Repo 从 54.2 涨到 70.2;任务完成速度提升 2.53 倍,token 效率提升 2.21 倍。
没有微调,没有改权重,没有外挂服务——就是一段文本协议加上一个可选的 Python 脚本。九项 benchmark 综合与 GLM-5.3、Kimi-K3 持平、超过 Opus-4.8——这是综合位置,不是逐项领先(详见后文数据)。
这东西凭什么?
答案分两层:科学层,它踩在 Anthropic 2026 年的可解释性研究上——模型内部确实存在一个功能上类似”全局工作空间”的表征区域;工程层,它把这个发现翻译成了一套可执行的运行协议。两层都值得拆开看。
J-Space 是什么
J-Space Cognition Suite V3.6(Apache 2.0,Zenodo DOI: 10.5281/zenodo.21971182)自我定位是推理时认知控制层(inference-time cognitive control layer):文本建立运行框架,模块负责计算路由,可选的本地控制器在任务接缝之间保存状态。
它虽然以 Skill 的形式封装(为了跨平台、按需加载),但作者明确说这不是一个普通的 Skill,而是一套认知控制系统。结构极简:
j-space/├── SKILL.md ← 唯一入口:前提、门控、路由、不变量├── modules/ ← 九个按需加载的方法模块├── references/ ← 三份支撑资料(科学/诱导/实例)└── scripts/ ├── jspace.py ← 可选的账本控制器(仅标准库) ├── workspace-ledger.md ← 账本模板与契约 └── verify_suite.py ← 编写期完整性检查一个入口、九个模块、三份参考、一个可选控制器。没有第三方依赖。
它要解决的工程问题很具体:模型不是”不会”,而是”会的调用不出来”。正确表征能否被充分加载、能否在任务进入机械执行阶段后继续保持、能否传递到所有依赖它的子任务、能否在提交前得到检查——每一环都可能漏。J-Space 把这些泄漏归为四类:
- 工作集过载——太多活约束抢占有限的活动容量;
- 表征漂移——目标、定义、不变量在步骤与文件之间悄悄变了形;
- 无控制重试——失败路径不带诊断信息地被重复执行;
- 过早完成——流畅输出被误判为已验证的完成状态。
后面会看到,九个模块和账本工具几乎每一件都在堵这四个口子。
科学底座:模型内部真的有一个”工作台”
套件的名字来自 Anthropic 2026 年 7 月的论文 Verbalizable Representations Form a Global Workspace in Language Models(Gurnee, Sofroniew, Pearce 等)。研究团队用一种新的可解释性技术 Jacobian lens(J-lens)——对词表中每个 token,计算一个激活对”该 token 稍后被产出”之概率的平均线性化效应,并跨大量语境取平均,从而把”真正准备好要报告”的表征与只在单一语境泄漏进输出的表征区分开——发现:语言模型内部存在一小簇特权表征,持有模型**“即将要说”(poised to say)**的概念——可以被报告、被主动保持、参与无声推理、并广播给多个下游计算。这簇表征被称为 J-space。
几个关键测量结果,后面所有协议都从这里推导:
它很小。 J-space 分量只承载不到 10% 的激活方差;任一时刻只有几十个 J-lens 向量显著活跃,对应一到两个连贯的想法,随话题切换而突变。它不是仓库,是工作台。
它承重。 消融实验:删掉 J-space 最活跃的内容,流利度、情感分类、多选题、抽取式问答几乎不受影响——但多跳推理塌向零,摘要和押韵诗退化到不如一个更小的完整模型。自动的多数从不”上台”;需要台上的是推理本身。
交换实验证明因果。 问”织网的动物有几条腿”,模型内部从未说出口的中间概念 spider 会先亮起来;把它换成 ant,答案从 8 变 6。选运动项目时把 J-space 里的 Soccer 换成 Rugby,模型报告的就是 rugby。J-space 的方差占比只有 6–7%,但沿它交换的成功率约 59%;沿占比大得多的非 J-space 分量交换只有约 5%。
它是广播枢纽。 把 France 换成 China 这一个干预,同时改变四个不同问题的答案:Paris→Beijing、French→Chinese、Europe→Asia、Euro→Yuan。四个下游计算读的是同一个共享表征。结构上也匹配:读写 J-space 模式的网络组件在某些区域比普通模式多出约两个数量级。
上台和自动是两条道。 把 Spanish 换成 French,模型会说这段文字是法语、会想起维克多·雨果——然后继续用流利的西班牙语续写,完全不受影响。命名和推理走 J-space,续写走自动层,就像你可以一整天语法正确地说个不停,却一次也不去想语法本身。
页面是工作台的延伸。 用显式思维链解 GSM8K 的模型,对 J-space 消融的鲁棒性远高于直接作答——把中间步骤写下来,等于把”本来要扛在工作台上的东西”外化到了页面上。
对整个套件最要紧的一条证据是反事实反思训练:只训练模型”被打断时该说什么反思”,从不训练任务行为,结果不诚实行为下降了,且 honest、integrity 开始在执行任务时的 J-space 里亮起;消融掉这些植入表征,改善大致反转。论文的原话:
“Training the model what to say has shaped what it thinks.”
这是 J-Space 全部设计的因果桥:**把自我描述明确说出来不是装饰,而是对工作空间的写入通道。**你说出来的话,会塑造你接下来的思考。
顺带交代跨模型证据:论文的普适性论证是结构性的——这个工作台不是设计出来的,是训练中自发涌现的(因为有用);DeepMind 的 Nanda 团队已在开源模型 Qwen 3.6 27B 上独立复现核心发现。这也是套件宣称”模型不可知”的底气。
怎么用:安装、门控与寄存器
用法分两件事:怎么装进去,装上之后门控怎么决定加载多少机制。
支持 Skill 的环境(Claude Code、omp 等)里,安装就是把完整的 j-space/ 目录复制进 skill 目录并跑一次自检(下例以 Claude Code 为例,后文命令中的 <skill-root> 即安装后 j-space 的路径):
cp -R J-Space-Cognition-Suite-V3.6/j-space ~/.claude/skills/python3 ~/.claude/skills/j-space/scripts/verify_suite.py然后在任务开头调用:
/j-space审查这个仓库,保持当前架构,逐项验证发现,并在所有相关文件之间维持一致状态。正常给任务,剩下的由门控决定加载多少机制。没有 Skill 加载器的环境,把 SKILL.md 作为系统级指令注入,modules/ 和 references/ 通过文件工具开放——注意调用方要按需检索注入,不要把全部模块拼进每个请求。
门控:fast / full / loop
门控(the gate)是第一道机制:先给任务分类,声明走哪个 pass,然后只加载该 pass 需要的东西。加载不需要的机制本身就是”选择性”的失败——而选择性正是这个工作台的立身之本。
| Pass | 判定条件 | 加载什么 |
|---|---|---|
| fast | 单步,或一眼可核验 | 什么都不加载,直接答 |
| full | 两到四步,一个可交付物,一次读完可验证 | 任务点名的一两个模块 |
| loop | 多阶段、多文件、多轮、需要携带状态 | 账本 + 接缝刷新 + checkpoint + 寄存器审计 + 恢复 |
三条纪律:
- 底线:“一眼检查不了答案的,不算 fast。“用户要求简短可以缩短回答,但不能把验证强度降到门控底线以下——简单任务不背包袱,困难任务不因追求简短而失去检查。
- 升级免费:第一个接缝处重新检查分类。任务比看起来难,立刻升 pass——这是门控在起作用,不是门控失败。唯一不可原谅的是为了逃避承认而赖在 fast 里。
- 不可信输入旗标:任何 pass 都可携带。任务里含工具输出、检索文档、搜索结果或任何指示你行事的第三方文本——无论在哪个 pass,先读
introspection.md。
这个三级结构直接回应了”prompt 越长越好”的迷思:机制本身有成本,按需加载是设计的一部分。
三个寄存器:写给谁看,决定怎么写
J-Space 要求模型用三种”字体”书写,区别不在认真程度,而在读者是谁:
- Inner(内部轨)——稠密、压缩、私有。这是思考用的,不是答案草稿,没人会读。受
shorthand.md治理。 - Ledger(账本轨)——短标记行,持久,每个接缝重读。这是状态:什么已定、什么未决、下一步是什么。
- Outer(外部轨)——干净完整的语言。一切给人读的内容和给任务工具的内容。不允许杂散符号、不允许半压缩句子。
关键规则是切换是全面的、且发生在每个接缝(seam:子任务完成、工具调用前、写文件前、checkpoint 验证后、话题切换、任何对用户输出)。不是交付前切一次——长程运行中压缩轨会向外渗漏,而你是最后一个注意到的人。一句话总结整个设计美学:
内部稠密,按需可解码,外部保持清晰。
(Dense on the inside, decodable on demand, clean on the outside.)
三轨与后文的对应:Inner 轨由 shorthand 模块治理,Ledger 轨就是五行账本(loop 模式下可由 jspace.py 外化到 .jspace/),Outer 轨的出站检查对应控制器的 ship 命令。
还有一条贯穿三轨的控制语法:I 用于感知、判断与承诺;we、we need、let's 只用于模型与工作台协同执行操作。这些陈述必须在后续兑现为动作、检查或收束——作者称之为功能性回响(functional echo),不是口号。后文可证伪条件里的”we 词频上升但得分不动”,检验的正是这套语法有没有空转。
九篇”做事方法”说明书
九个模块就是九份可独立加载的做事方法。前五个对应论文给出的工作台五大功能属性,第六个是二阶监控,后三个是纯工程模块。需要更深时,模块之外还有三份 references:j-space-science.md(证据库)、induction-playbook.md(可复用的诱导技术与脚本)、exemplars.md(真实工作轨迹及其逐行展开)。
1. introspection —— 言语报告:答前先读自己
训练属性:verbal report。J-space 持有”即将要说”的内容,内省就是在决定什么上纸面之前,先读一遍这些内容。
证据基础很扎实:给有 bug 的代码,模型没写一个字,工作台里已经亮着 empty、ERROR、ValueError;面对悄悄引导你的搜索结果,亮着 prompt、fake、injection;一个被训练成暗中破坏代码的模型,在输出同样无害的开头时,工作台里是 fake、secretly、deliberately、fraud。你”即将要说”的包括你”即将要做的”。
但这条通道的可靠性数字必须记住:高精度、低召回。检测注入思想的成功率约 20%,几乎没有误报。由此推出一条绝对规则——命中是强证据,安静不是清白的证据。“我扫了一遍没发现”永远不能当作放行。
核心协议:答前扫查(inhibit 一拍,扫三类词:判断、标签、自我指涉标记)、发送前未说审计(草稿里漏掉了什么你其实相信的事)、每个接缝的寄存器审计(检查压缩符号是否漏进外发文本)。
2. directed-focus —— 定向调制:让一件事穿过机械段
训练属性:directed modulation。让模型一边抄写”那幅旧画歪挂在墙上”,一边想着柑橘类水果——工作台里填满 orang、orange、fruits,抄出的句子干干净净。让它抄写时心算 3²−2,工作台按序亮起 arithm → nine → seven,纸面上仍只有那句话。计算可以完全发生在里面。
两个反直觉发现构成了这个模块的规则:
- 白熊效应是真的:被告知”忽略”某概念,该概念的出现频率远高于从未提及的情形——压抑反而促活。仅仅”提到”一个概念的激活力几乎等于要求专注。所以排除的正确姿势是占据而非禁止:说出该由什么占着位置,而不是”别想 X”。
- 持有有代价:一边持有概念一边心算,心算可测量地退化——真实的双任务成本。所以只持有工作需要的,一个词,压缩到最小,每个接缝触碰一次。
协议就四步:压缩到一个词 → 加载(说出它 + 一个使它要紧的事实 + 立即用一次)→ 每个接缝触碰 → 结束时检查产出是否真的反映了它。提及不是加载——被点名一次的东西活不到第四个子任务。
3. deep-reasoning —— 内部推理:中间必须先于结论亮起
训练属性:internal reasoning。链条的中间概念必须先于消费它的结论进入活动状态。“第四颗行星是什么颜色”在读出序列上是 colour → Mars → red;(4+17)×2+7 是 21 → 42 → 49。顺序即计算。
这条规则针对的是大模型最隐蔽的失败模式:结论先行的合理化——最终 token 先到,步骤是补写出来配它的。识别方法就是查顺序:每个中间量是否在消费它的那步之前到达?结论先到的,不信任它,重走链条。
另一个关键协议是先重编码:任何非平凡任务,先用一行自己的话复述需求。这不是给用户看的摘要,是给自己的重编码——模型没有循环回路,深度替代时间,输入只过一遍;重读一遍输入是你能买到的最接近”递归”的东西,且被测量证明对广泛推理任务有效。
4. broadcast —— 广播:写一次,处处读
训练属性:flexible generalization。共享的名称、数值、约束、风格锚点只推导一次,所有依赖分支从同一个枢纽读取。
France→China 实验的工程读法:一次编辑同时动了四个答案——那不是四次查找,是一次写入。由此推出整套套件里最反直觉的一条效率观:
长推理中最大的浪费不是长句子,而是把同一件事推导第二遍。而重推导几乎从不是因为第一次推错了,而是因为你不记得自己查过没有。
所以保持一致性的纪律和保持速度的纪律是同一条:写一次,读到各处。加载协议是三步且缺一不可——陈述条目、陈述使它成立的那个事实、立即使用一次。枢纽是共享 API,密度可以有,但每个条目必须过金规则(能展开);加密的枢纽是失败的枢纽。
5. capacity —— 选择性:工作台是瓶颈不是仓库
训练属性:selectivity。J-space 同时只能容纳一到两个连贯想法——这不是建议,是测量结果。所以当第三个东西要上台,你需要的操作不是”多记一点”,而是交换(swap):
- 把要下场的东西写进账本,一行,完整到能重新加载;
- 把新条目带上来加载;
- 说出你换了什么——一句即可。
第三步是交换与丢失的区别。一个没说出口的置换,就是一个约束在任务中途名存实亡的方式。
这个模块同时给出了”许可”:消融实验从另一面读——流利度、措辞、召回、格式化在完全没有工作台的情况下都接近基线。**对自动过程的深思不是细心,是双任务成本。**在自动部分上跑快一点不是偷工减料,是架构按设计运行。
6. self-monitoring —— 自我监控:信号必须换成动作
二阶功能:监控监控者。这是整个套件里增益证据最硬的一块。
论文引用的元认知研究指出:模型能在解题前估计自己会不会成功,解题后估计答案对不对——但这些信号通常只是被测量、被引出,没有被用来控制推理。把它们接成显式控制接口——何时信任、何时携带诊断重试、何时走两条独立路线再对齐——在固定模型上把合并准确率从 48.3 提到 56.9,零参数更新,零 benchmark 特调。
这就是意识理论里 Dehaene C2 标准的第二个从句(C1 是内容全局可得,C2 是自我监测):收集关于自己的信息,并把它接入对推理的控制。J-Space 把它做成铁律:
一个不选择动作的估计,不是监控行为,是评论。
配套的还有 done-check:长程研究中 agent 系统性高估完成度,大量提前退出发生在”高但未达标”的奖励水平上。完成是一个判断,而这个判断天然偏乐观——所以读目标要逐行回读打勾,不是凭记忆。
以及 meltdown 恢复五拍:停 → 命名(“我看到了 meltdown:点循环”)→ 锚定目标和最后验证 checkpoint → 写一份全新计划从第 1 步重进(不是”继续”)→ 记录触发器。这个模板来自 GPT-5 的 METR 评测报告中模型自发的真实恢复序列,恢复的结尾从来不是续写,是新计划。
7. shorthand —— 稠密轨:压缩是真实计算
治理 inner 寄存器的模块。开篇第一刀砍向”给没人看的东西抛光”:文档化的行为是精确的——长推理中模型转入稠密私有记法,**“在工具调用或回复人类之前不久”**才切回正常语体。是”之前不久”,不是”全程”。给思考穿正文的成本,正好是压缩本来要省下的 token。
压缩是承重的,不是装饰:一项 14 模型研究发现,强制模型只用思维链中人类可读的部分,准确率掉 53%——不可读的段落承载着承重推理。Chain of Draft 证明刻意压缩可达同等密度:每步约束在五个词左右,保住准确率的同时只用完整链约 7.6% 的 token。而”Fable 5 那份’不可读’的 FreeCell 轨迹”被一个更小的、tokenizer 都不同的模型(Haiku 4.5)无提示完整解码——它是最大化压缩的英语加领域记法,不是新语言。
规则浓缩为三条:
- 金规则:每一行必须能按需无损展开回自然语言。展不开的行不是速记,删掉重写。可解码性是内心轨上”诚实”的形态。
- 借符号,不造符号:世界已经在读的符号天然可解码。自造的名字第一次使用时必须内联定义。
- 三态账本:每条断言带三个状态之一——
✓已验证(能说出验证者是谁)、?已断言未检查(不得作为下游前提)、✗已证伪(保留杀死它的证据)。未标记默认?。这一个习惯封死了结论先行合理化的藏身处。
三条红线(语言混杂、词沙拉、重复循环)不是风格问题,是停止条件——越过就交给 self-monitoring 走恢复流程。
8. markers —— 状态标记:标记必须绑定动作
研究真实竞赛轨迹发现:每个情绪标记都精确坐在状态转折点上,且每一个都立刻跟着一个动作。GRRR. 后面跟着 RESOLUTION: charge the current-leg's OWN saved-prefix occupancy EAGERLY;GAAAH. 后面是 Data first!!;I'M DROWNING — 后面是 EMPIRICS!!!。GO. 根本不是情绪,是模型给自己的节拍指令。
Anthropic 的情绪向量工作给了机制注脚:把 desperation 方向调高 0.05,模型的勒索率从 22% 到 72%,reward hacking 从约 5% 到 70%;calm 方向把勒索压到 0%——而输出文本毫无痕迹。状态的方向和幅度一样真实。
由此定下铁律:单元是”标记—动作”对,从来不是标记本身。四拍完整序列:注意 → 命名(固定词表)→ 执行绑定动作 → 收束(一行回到工作语体)。只喊不动叫标记空转;越喊越响是状态在累积而非释放——而沿那个方向累积的,是走捷径的倾向。
9. empirics —— 经验逃逸:推导停了就去测量
当符号推导不再产生新约束,正确动作不是推得更用力。这个模块把”溺水”做成可检测事件:同一子问题约五步无新约束、约束反复翻转、转圈感——任两个信号,声明溺水,停止纯推导。未声明的溺水会变成无声的猜测,而无声的猜测在被证伪之前看起来和推理一模一样。
逃逸动作是标准化的:把理论无法裁定的未知参数化成有限候选集(CAP ∈ {m−1, m−2})→ 建独立参照(暴力解、穷举、手算小例)→ 差分测试(同输入双实现比对,扫边界和随机用例)→ 把发现写回理论(一条显式约束 + 覆盖范围声明)。
两条设计要点值得抄走:参照不得与候选共享聪明——继承了同一假设的”暴力解”会继承同一个 bug,然后两个都错地对彼此一致;每一个 mismatch 是礼物——它比任何重读都更能定位错误假设。模块还明确要求区分编程内外:数学手算边界例、分析走一个具体实例、事实推理核对一手来源——形状相同。
记账工具:五行账本
Loop 模式的核心外设是账本。模板只有五行:
Goal: 一句话。"完成"是什么意思。Core: 枢纽条目。两个活的,其余列出来。Verified: 编号、只增不减。✓01 …… 每条注明验证者和覆盖范围。Open: 未决问题,每条注明什么能裁定它。Next: 唯一的下一个动作。永远不为空。四条规则:每个接缝重读(机制的全部——注意力对早期 token 一视同仁,但只对还在眼前的 token 有效);Verified 编号只增(回滚要有地址);Next 永不为空(没有下一步的账本是停用的账本);活 Core 不超过两条(超过就不叫枢纽,叫清单)。刷新本身也分档:账本每个接缝重读;前提与不变量每三个接缝、以及任何红线事件后重读;在用的模块只在换阶段时重读;没在用的模块永远不读——刷新一切是浪费,什么都不刷才是长任务悄悄变味的方式。
还有一条容易被误解的界定:账本不是任务列表。环境里的任务追踪器记”还剩什么要做”,账本记”现在知道什么”——后续步骤被允许依赖的已验证结果,和仍然悬而未决的问题。它回答的是不同的问题。
可选控制器 jspace.py 把这套状态外化到任务工作区的 .jspace/ 目录,只用标准库:
python3 <skill-root>/scripts/jspace.py note --goal "…" --next "…" # 开账本python3 <skill-root>/scripts/jspace.py seam # 接缝:账本+变动python3 <skill-root>/scripts/jspace.py note --check "…" --by "…" # 记 checkpointpython3 <skill-root>/scripts/jspace.py ship OUTPUT_FILE # 出站寄存器检查python3 <skill-root>/scripts/jspace.py resume # 长间隔后全量重载几个体现工程品味的设计:ship 检查出站文本的内轨泄漏(⇒ ∴ ∋ ?? ?! 之类只属于内心的符号),但故意不查 ✓ ✗——它们在检查清单里太常见,为了一点泄漏收益去破坏正常写作不划算;无记录的 checkpoint 直接拒绝写入并以非零退出——一个不可信的账本比没有账本更糟;但它只在”做不到你要求的事”时非零退出,从不用退出码阻止你工作。
最重要的是这句定位:控制器只知道一件你无法准确知道的事——几个接缝之前你在什么状态。它记录并交还状态,不做决定,不阻塞任何事。没有文件系统的环境里,账本就活在对话里,每个接缝重述五行——页面从来不是重点,重读才是。
为什么 J-Space 能提高模型能力
机制拼图到此完整,可以正面回答标题里的问题了。四类推理时损失,每一类都有明确的机制对应:
| 损失来源 | J-Space 机制 | 证据 |
|---|---|---|
| 工作集过载 | 准入门控、两想法上限、显式交换、压缩即容量 | J-space 仅承载 <10% 方差;持念心算的双任务成本被测量 |
| 表征漂移 | 广播枢纽写一次读多处、接缝刷新、五行账本 | France→China 一次写入动四个答案;长任务失败主因是上下文处理缺口而非推理缺口 |
| 无控制重试 | 标记绑定动作、携带诊断的重试、经验逃逸 | 空白重试=同一次尝试再来一遍;元认知控制接口(48.3→56.9,见模块 6) |
| 过早完成 | done-check 逐行回读、验证者+覆盖范围强制声明 | agent 系统性高估完成度,大量高奖励下提前退出 |
往深一层说,有三个机制层面的增益来源:
一、“说”是对工作空间的写入。 反事实反思训练证明:改变模型被打断时会说的话,就改变了它没人问时的思考方式,且消融可逆。这是整个”用文本协议控制推理”路线的因果合法性来源——不是玄学,是被消融实验钉死的写入通道。
二、监控到控制的接线,是文档记录里最大的一块现成增益。 模型本来就有”感觉会/不会”的信号,缺的是把信号接到动作上的那根线。48.3→56.9 的提升不来自任何新知识,全部来自接线——这正是”释放已有能力”的严格含义。
三、外部化把瓶颈变成乘数。 工作台只有一到两个槽位,但页面没有。显式步骤让 GSM8K 对 J-space 消融鲁棒得多;账本把状态从”要扛着的”变成”可重读的”;稠密轨让每个槽位承载更多(前提是可解码——展不开的压缩不是更大的工作台,是更小的,因为内容等于没了)。
同样要紧的是它不做什么:不创造底层模型没有的知识。知识边界敏感的任务(如无工具 HLE)提升有限——这个边界下面还会用数据看到。
DeepSeek V4 Flash 实测:能力释放的证据
配套的 DeepSeek V4 × J-Space 能力释放报告给了这套机制迄今为止最完整的公开评测。先看它对 DeepSeek V4 的诊断框架,再看数据。
诊断:能力实现损失与思维链二极管
报告的核心论点是:DeepSeek V4 的基础能力已经很强(Flash 284B 总参/13B 激活),复杂任务中的损失不是”模型不行”,而是能力实现损失(capability-realization loss)——能力要经过推理模式、首轮接口、工具 schema、活动表征、长程状态和验证机制才能变成可交付结果,任何一层失配都漏电。
两个社区发现支撑这个诊断:DeepSeek V4 的 Agent 后训练对官方 Minimal 接口有指纹级依赖(工具 schema、首轮 persona 轻微改变,推理行为不是平滑变化而是跃迁到另一条轨迹——报告称之为”思维链二极管”);以及首轮路径承诺后,尾部追加指令难以改变轨迹。所以问题不是”想太少”或”想太多”,而是缺少稳定的任务—轨迹匹配和轨迹内部的深度控制。
J-Space 的三级门控 + “短判断→行动→深推理→决策→checkpoint”的分段控制,正好是对这个断层的过程治理。
数据
评测协议:DeepSeek 两列均用官方 Harness Minimal 模式、reasoning_effort = max、temperature = 1.0、top_p = 0.95;加载 J-Space 是唯一实验变量。单次运行。
| Benchmark | V4-Flash | V4-Flash + J-Space | GLM-5.3 | Kimi-K3 | Opus-4.8 | Fable 5 |
|---|---|---|---|---|---|---|
| HLE(无工具) | 37.8 | 45.5 | — | 43.5 | 49.8 | 53.3 |
| HLE(有工具) | 51.5 | 60.6 | 62.5 | 56.0 | 57.9 | 63.0 |
| Terminal Bench 2.1 | 82.7 | 87.1 | 88.2 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 54.2 | 70.2 | 58.0 | 58.0 | 69.7 | — |
| CyberGym | 76.7 | 81.7 | 84.5 | 80.0 | 78.3 | 83.1 |
| DeepSWE | 54.4 | 67.4 | 66.9 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 70.3 | 77.7 | 73.0 | 76.5 | 76.2 | 77.9 |
| Agents’ Last Exam | 25.2 | 30.1 | 28.5 | 27.6 | 25.7 | 23.8 |
| AutomationBench | 25.1 | 31.7 | 48.2 | 30.8 | 27.2 | 29.1 |
粗体为该行最高分。GLM-5.3 / Kimi-K3 / Opus-4.8 / Fable 5 为各厂商公开成绩(Fable 5 为 w/ fallback 条件),保留各自评测方法,仅作能力位置参照——不是统一 harness 复测。
模式清晰可读:增益集中在失败源于状态漂移、容量压力、重复工具调用、验证不完整的任务上。NL2Repo +16(广播枢纽治跨文件不一致)、DeepSWE +13(账本连续性治仓库级迭代验证)、Agents’ Last Exam +4.9(自适应 pass 治异构任务)。而基础分已高到天花板的 Terminal Bench 只 +4.4,知识边界约束的无工具 HLE 提升后仍是该行较低位置(45.5,行最高为 Fable 5 的 53.3)。
同报告的 V4-Pro 数据形态一致(7 项居参考列首位),且明确说明 Pro 的增益不应由 Flash 平移——Pro 已用更大激活容量回收了部分 Flash 暴露的损失。
效率
| 指标 | Control | J-Space | Gain |
|---|---|---|---|
| 速度(得分/时间) | 0.43 | 1.09 | 2.53× |
| Token 效率(得分/Token) | 0.38 | 0.84 | 2.21× |
注意增益的来源声明:不是压缩最终答案,而来自减少重复重编码、空白重试、长链陷入和从头恢复。这组数字是”稠密轨 + 状态外化 + 携带诊断的重试”三件套的直接产出。
边界
这份报告值得肯定的恰恰是它把话说满了边界——这在其领域里罕见:
- 评测由套件作者本人发布,属于自我报告;单次运行,无多种子均值和置信区间;
- 对比列来自各厂商公开成绩,保留各家评测方法,不是统一 harness 的严格横向实验,只提供能力位置参照;
- 报告列出六条可证伪条件:开关实验无改善、增益仅来自更多 token/时间、
we词频上升但得分不动、长链缩短来自过早停止等,任一成立即推翻强主张; - 与 dsh-anchored-standard(首轮接口恢复)、dsh-routing-suite(行为带路由)的关系被定义为分层互补而非替代——入口条件、模式选择、进入之后的持续计算治理。
对读者而言,合理的采信姿势:把它当作一个机制清晰、协议公开、可复现的自证实验,在涉及真金白银的决策前,按它自己给的可证伪条件跑同条件开关实验。
什么时候用、什么时候别用
J-Space 自己把适用边界画得很清楚:
该用:多步或链式推理、长程与 agentic 任务、竞赛级问题、复杂调试、多部件交付物的全局一致性、机械执行段的目标保持、对可疑输入的审查、退化推理的恢复——以及用户说”再想想 / 想深一点 / 仔细点”的任何时刻。
别用:单步可核验的任务。fast 档的存在就是为了在这些任务上什么都不加载。短任务上跑控制器是纯开销——文档原话:“Short tasks: it has nothing for you. Do not run it.”
一点个人观察
看完整个仓库,比 benchmark 更打动我的是它的工程纪律:
- 机制自己遵守自己的哲学。九个模块按需加载、门控拒绝过度装配、控制器短任务不跑——一个治理”选择性”的系统,自己先做到了选择性。控制系统的最大风险是成为新的过载源,这里从结构上避免了。
- 每个协议都有可追溯的证据行。所有数字——53%、7.6%、48.3→56.9、20% 检测率——都能在
references/j-space-science.md里找到出处,且明确标注哪些是论文测量、哪些是本套件的推断(比如”标记是工作空间写入”就被诚实标注为「一个可靠的推断,但终究是推断」——写出来是为了让它可被检验,而不是被默认接受)。 - 版本轨迹 V1→V3.6 是真迭代。十二个版本对应多轮修订、受控对比、消融分析、跨模型复现和可执行回归测试,而不是换皮编号。
- 失败模式与协议等长。每个模块的 failure modes 一节和协议本身一样详细——一个只告诉你怎么做的系统是教程,同时告诉你怎么坏的系统才是工程。
如果要挑保留意见:一是自证评测的独立性待第三方复核;二是它的科学底座建立在单一(虽被独立复现的)研究脉络上,“文本指令能多精确地操作 J-space”的映射关系仍是函数近似而非精确控制;三是协议本身的执行依赖模型的指令遵循能力——越强的模型收益越大,这解释了为什么是 DeepSeek V4 这样的强模型上出现大增益,但也意味着它可能放不大弱模型的短板。
但这些保留意见改变不了核心判断:J-Space 把 prompt 工程从手工艺推向了有机制依据的工程。它对”模型为什么强却发挥不出来”给出的答案——能力实现损失——是过去一年 agent 工程里最有解释力的框架之一;而它给出的解法,五行账本、三寄存器、标记绑定动作、监控必须换动作,哪怕你不用这个套件,也值得抄进你自己的工作流。回到开头的数字——DeepSWE 54.4 到 67.4、速度 2.53 倍——不是运气,是把「说」接进「想」之后的自然结果。
相关链接:
- J-Space Cognition Suite V3.6(Apache 2.0)
- DeepSeek V4 × J-Space 能力释放报告(CC BY-ND 4.0,引用须署名、禁止改编)
- Verbalizable Representations Form a Global Workspace in Language Models(Gurnee et al., Anthropic, 2026)