Logos: An Agent Harness on a Cross-Process Bus —— 精读
论文链接:https://arxiv.org/abs/2608.28553
发表时间:2026 年 8 月 28 日(arXiv:2608.28553v1);AAMAS 2027 Research Paper Track(2027 年 5 月,越南河内)
发表机构:University of Sussex(英国,第一作者 Hanzhang Jia)、浙江工商大学(杭州)、上海书缘信息技术有限公司
领域标签:cs.AI;LLM agents、agent infrastructure、distributed systems、hot swapping、fault tolerance、composability
这是一篇典型的跨国校企合作论文:第一作者来自英国 Sussex,合作方包括杭州的高校与上海的一家民企,三方共同完成了一个形式化理论加工程实现的完整闭环。
一、论文背景
1.1 Agent 系统正在变成『运行时组装的软件』
现代 LLM agent 系统早已不是一段写死的程序,而是在运行时动态组装能力:按需加载工具、挂载中间件、注册事件监听器,任务结束后再卸载并撤销其影响。这有点像乐高——能力是积木,agent 是搭起来的作品,而且这个作品还在运行中不断拆装。
2026 年 8 月的时空可组合性演算(spatiotemporal-composability calculus,arXiv:2608.25512)给这种动态组装提供了完整的形式化处理:一个能力是一个携带被跟踪逆操作的组件,装配施加效果、卸载执行记录的逆操作,agent 由这些组件作为插件组装而成。DeepSeek 开源的 DeepSeek Harness(『一切皆插件』)就是这个演算的参考实现。演算证明了可逆性保证:任何装配序列都可以按相反顺序撤销。
1.2 单进程:数学上的隔离,物理上的连坐
问题在于,这套理论落地时所有插件、所有装配/卸载记录、所有会话都装在一个进程里。论文列出了四项工程代价:
- 物理故障连坐:宿主进程崩溃、内存耗尽或事件循环阻塞,会一次性终止所有组件——组件之间在数学上的隔离,在共享进程内部失去了意义。
- 会话同归于尽:进程死亡会终止它承载的每一个会话,恢复需要重启整个栈。
- 升级代价大:替换或升级一个插件需要进程重启或重载,会连带拆除并重跑所有依赖者,所有驻留会话一起停摆。
- 单语言牢笼:进程是单语言环境,插件被限制在宿主语言里,跨语言复用要走翻译层和远程调用。
一个直观的类比:所有员工挤在一间没有任何防火分区的办公楼里,任何一个角落着火,全楼疏散;想给某一层装修,整栋楼都得停业。
1.3 已有方案各自『搬走』了什么,却没人搬走组合本身
现有分布式方案确实都在往进程外搬东西:MCP 及其衍生把工具服务器搬出进程,但组合逻辑与会话状态仍留在宿主;Temporal 这类持久化执行引擎把执行搬出进程,但装配仍留在工作流定义里。而 AutoGen、LangGraph 这类进程内框架什么都不搬。论文的切入点正是这个空白——把组合与装配本身搬出进程。
1.4 一个被忽视的事实:可靠性保证可能根本不关心进程
论文最关键的观察是:演算的可靠性不变量定义在状态空间上,它的定义只涉及上下文、映射的复合,不涉及任何进程、内存或闭包。也就是说,把 agent 绑在一个进程里的可能从来不是数学,而只是参考实现的工程选择。如果这个判断成立,跨进程的可靠 agent 系统就有了理论通路——这就是 Logos 的出发点。
二、论文定位和关联工作
2.1 研究谱系一:进程内 agent 框架
AutoGen 通过对话编程组织能力,LangGraph 通过状态图组织能力,但两者都把能力做成宿主进程内的库对象。它们与 Logos 的区别在于:Logos 给每个能力独立的操作系统进程,把组合放到总线上。这条谱系证明了插件式 agent 的可行性,但也固化了单进程的默认形态。
2.2 研究谱系二:分布式 agent 基础设施
- MCP 及其衍生:把工具服务器与调用移出进程,但组合与会话状态留在宿主。
- Temporal 及其同类:把执行移出进程,装配留在工作流定义中,恢复靠历史重放(这一点与 Logos 的转录重放神似,但层次不同——Temporal 重放的是执行,Logos 重放的是装配语义)。
2.3 研究谱系三:机器人操作系统(ROS)
Logos 直接继承了 ROS 的架构血统:对等进程、基于名字的路由。ROS 在机器人领域验证了『节点即进程、主题总线通信』的工程可行性,Logos 把这套思想搬到 LLM agent 基础设施上,并用演算的语言重新论证了其可靠性。
2.4 研究谱系四:形式化基础与并行工作
- 时空可组合性演算(arXiv:2608.25512):本文的直接出发点,证明了单进程内的可逆性保证。Logos 以其为前提扩展到多进程载体。
- AgentGit(arXiv:2511.00628)与 λA 类型化 lambda 演算(arXiv:2604.11767):两篇平行预印本研究 agent 状态与历史的相邻问题,但都不研究跨进程可逆性。
2.5 定位总结
| 框架 | 移出进程的东西 | 留在进程里的东西 |
|---|---|---|
| MCP 及衍生 | 工具服务器与调用 | 组合与会话状态 |
| Temporal 及同类 | 执行 | 装配与工作流定义 |
| AutoGen / LangGraph | 无 | 全部能力(进程内对象) |
| Logos | 组合与装配,状态进转录 | 只剩路由表 |
Logos 在这条脉络里的位置非常清晰:它是时空可组合性演算的跨进程延伸,做的是前人没碰过的『组合搬家』,并且不是只给架构图,而是给了充分条件定理、最小构造和全套对抗性测量。
三、问题定义
3.1 从具体困扰到抽象结构
具体问题是工程性的:进程会死、会卡、会被重启,怎么让 agent 系统在这些故障下仍然满足演算的可逆性保证?但如果只停留在工程层面,每个补丁都只是特判。论文的抽象路径是问:演算到底在什么上定义?
论文发现两个建模事实:
- 事实一:语言模型的每次前向传播是一个无状态纯映射,所有跨步状态本来就活在模型之外,输入可以在任何地方合成。
- 事实二:最小模型就是 y = f(x),输入合成与输出解析都是 f 之外的操作,多轮会话只是嵌套的 f 调用加上外层的合成与解析路由。
这两个事实合起来意味着:会话是一系列作用于外部状态区的无状态映射,与模型共驻一进程从来不是必需品,而是一种选择。
3.2 形式化:忠实指派
论文放松『组件与记录共存一个进程』的限制,允许把它们任意指派到 N 个进程。定义:
- 抽象迹 τ:状态空间中装配/卸载步骤的序列(数学上理想的执行);
- 实现迹 τ′:各进程实际执行的步骤序列;
- 忠实指派:对每个抽象迹 τ 都存在实现迹 τ′,使两者在宏状态投影 Π 下逐点相等,即 Π(τ′) = Π(τ)。
这里的观测等价 ≃ 与宏状态投影 Π 来自演算本身:两个状态若无观测者能区分即等价,宏状态是等价类。物理级的完全复原是不现实的理想化(内存指针、时间戳无法复原),一切恢复等式都在 ≃ 意义下成立。
3.3 这个抽象的精妙之处
问题被压缩成一句话:**什么条件下任意进程指派都是忠实的?**这个定义把进程边界、网络延迟、消息丢失全部排除在外,只剩下状态空间的投影一致性。如果充分条件足够弱(只依赖演算已有假设加模型无状态这一事实),那么跨进程就不是打补丁,而是理论允许范围内的自然实现选择。
四、问题解法
论文的解法分两层:先给四个引理一个定理(理论层),再给 Logos 构造(工程层)。四个引理的名字刻意用了大写 R 结尾的缩写风格, premises 全部来自演算假设与模型无状态性,不添加任何新数学假设。
4.1 引理一:编排外置
类比:把 LLM 想象成一个每次都失忆但极其聪明的顾问——他每次只看你递给他的材料给结论,自己不记任何东西。既然他不记东西,就没有理由让他坐在你的办公室里。
内容:若模型是无状态纯映射且合成/解析在其外,则所有跨步状态都驻留在一个共享区 S 中(运行时读写的存储,不在任何模型调用内部),运行时的全部角色就是输入合成 ω 与输出结算 ρ 两个操作,模型成为一个普通的可分发总线节点。证明是排除法:跨步状态不能住在无状态映射里,合成与解析被定义为外部操作,共享区是唯一剩余的住所;而共享区从任何地方都可读,输入 x = ω(S) 可以在任何进程合成。
4.2 引理二:载体替换
类比:可逆操作必须留底账。内存里的账本在进程死掉时一起消失,所以要么账本本身不朽,要么每次记账都抄写到不朽的载体上。
内容:设 D 为某段历史的逆数据(锚点 a_i 与逆映射 g_i)。一个带读出映射 ρ 的持久存储 C 是忠实载体,当且仅当每个锚点上 ρ(a_i) ≃ g_i;从载体按应用顺序复合重建的累加器与原累加器 ≃ 相等,经载体的恢复等价于原位恢复。三个推论特别精彩:
- 记录的必要性:可逆性必然留下记录——这是 Landauer 原理的常识形式(论文明确说不做正式引用)。容错部署中的进程内存对任何进程都不满足载体条件,因为进程会死。
- append-only 形式的推导:逆数据的代数是幺半群,幺半群元素最一般的持久载体是其生成元上的自由幺半群——恰好就是 append-only 转录。追加式日志不是工程偏好,是数学推导的终点。
- 冷切换:新进程导入转录、重建外部累加器、与失败进程保留的部分复合。原进程的离开不触碰可靠性不变量——进程只是一个可抛弃的辅助载体。
4.3 引理三:恢复局部化
类比:每间店铺自己保管自己的退货凭证,退货不需要全商场协调。
内容:若各组件的效果函数满足演算的成对独立性定义,则一个组件的逆数据只需驻留在它自己的进程里;全局恢复是各进程恢复的任意全局交错,进程之间不存在为恢复而设的顺序约束或共享状态。机理:局部后进先出序列的任意交错是全体逆的一个置换,而演算已证明恢复对所施逆的置换不变。系统中真正共享的可变状态是条目表(append 与 delete 操作),落在交换 key 满足的域内。
4.4 引理四:外部解析
内容:空间可组合性的操作要求——key 到提供者的实时解析、每 key 单写者、先供给后消费且消费后才撤销——其全部内容就是一张 key 到提供者的指派表,即路由表。注册是可逆效果,路由表驻留在状态空间的交换部分,由注册事件广播维护的副本与内存注册表观测等价。
4.5 定理与工程约束
定理 4.5:一个跨 N 进程的实现是演算加两个建模事实的忠实实现,当且仅当:
- 每个必须可逆的效果在发生步就把锚点写入持久转录;
- 每个 key 只有一个写者,在注册时强制。
理想模型之外,实际构造还须满足三条工程约束:E1 每个响应与其调用配对;E2 每个名字恰有一次注册,冲突申请得到显式拒绝;E3 每个观测者收到相同的供给变更通知序列。另外还有一个部署前提——尺度分离:总线毫秒级跳变对上百毫秒的首 token,拓扑在模型步长尺度上是平稳的。
4.6 Logos 构造
构造只做最小的搬移:总线取代宿主,路由表归总线,转录与事件流不属于任何进程,插件即进程。一条消息的完整路径:harness 从转录合成输入 → 模型作答 → 路由器转发工具调用 → 结果结算进转录 → 广播把变更带给每个节点。
| 组件 | 实现要点 |
|---|---|
| 总线 | 单 Go 进程路由器,三项职责:注册、转发、广播。路由器不调度、不读载荷。NDJSON over TCP,每行一个对象,帧上限 64MB,坏行跳过 |
| 投递分层 | 控制消息至少一次送达(全局调用 id 幂等配对,永不丢弃);有损流至多丢一个前缀,存活序列保持连续。每连接 1024 条有界出站队列与独立写协程;5 秒写超时断开;有损流满则丢最旧并计数,控制消息满则断开 |
| 路由表 | 名字到连接的映射,附带角色与能力表。任何节点可随时读全表。一个名字一行,冲突注册显式拒绝 |
| 转录 | append-only JSONL 文件,不属于任何进程,是唯一事实来源。展示给模型的消息是转录上的投影(长工具结果在投影中修剪,全文留在文件里) |
| 事件流 | 观测者节点把每次广播记入自己的 append-only 文件,覆盖系统行为;转录覆盖会话,两者分离 |
| 节点 | 任何符合协议的进程,三种角色:harness、tool、observer。Go、Python 3.13、Node.js 24 进程作为对等节点同跑一条总线 |
| 恢复 | 进程死后,同 id 的新进程导入转录、重建投影、继续会话。无回滚、无分叉,已记录的步骤绝不重做。结算顺序是先持久后可见:效果先追加进转录,再在总线上公告 |
| 装配纪律 | 缺提供者时挂载的组件处于等待态,其调用得到点名缺失能力的显式拒绝;后来者上线广播激活它,双方零代码改动。提供者下线触发重解析,同能力的新提供者重绑依赖者 |
重放检查四条不变量:I1 条目次序良好;I2 标识符单调;I3 每次工具使用恰有一个结果;I4 重建投影等于会话展示的消息。部署边界是可信网络(本机回环与私有网格),准入即注册,信任放在挂载时——由审查过代码的人启动工具进程。
五、评估指标与实验证据
5.1 实验设计总览
测试床:单机 AMD Ryzen 7 7435H、16GB 内存、Windows 11,路由器与所有节点为回环总线上的独立进程。涉及模型包括 DeepSeek V4 Flash/Pro、GLM-5.2/5.3、Claude Opus 5/4.6、GPT-5.4、GPT-Image-2。故障一律以从系统外部击杀活进程的方式注入。每条断言都用两个独立磁盘源交叉核对(转录与事件流),每个场景带重放命令。对比组使用演算参考实现(DeepSeek Harness v0.1.0-rc.5,250 个文件指纹存档)以原生方式组合同一份会话代码,零源码改动;两种配置接受相同注入,无故障基线差距仅 0.8%——测出的损伤属于故障本身。
5.2 指标体系与结果
主指标:故障后恢复正确性(冷切换无重复效应)
这是论文核心主张的直接检验。12 个端到端会话经历 6 次进程击杀,全部按相同标准交付,无任何已执行动作被重复,每次重启代价 1.36 秒。80 个进一步会话把击杀点覆盖到工具调用周期的四个边界——执行中、返回后持久化前、持久化后公告前、公告后——全部恢复完成且无重复效应,恢复后重做的工作恰好等于转录尚未记录的部分(前两个点 4 轮、第三个点 3 轮、第四个点 2 轮)。30 次扩展重放恢复 30/30 成功。
规模分离指标:总线跳延迟
10,000 次调用测得中位 0.215ms(P99 0.377ms,P99.9 0.623ms,最大 3.045ms)。进程内基线中位 0.005ms,总线比本地调用贵 43 倍。但模型侧首 token 中位 177ms、全推理中位 1896.8ms——一跳是首 token 的 1/823、全推理的 1/8822。这个指标衡量的本质能力是:分布式的代价在模型时间尺度上是否可见。三个数量级的差距说明拓扑在模型步长上平稳,这是定理部署前提的实证。
对抗性审计:总线三约束
- E1 配对:200 个并发调用方发出 3,500 次调用,每一次调用与应答配对,零丢失、零重复、零错配;
- E2 单注册:100 个同名并发申请,1 个胜出、99 个收到显式拒绝,重复名字从不进表;
- E3 公共顺序:50 个提供者 30 轮 churn 中,两个观测者记录到完全相同的供给变更序列,事件流单独即可重建最终路由表。
故障域指标:同故障对比(论文最有说服力的部分)
| 故障 | 单进程参考配置 | 对等进程构造 |
|---|---|---|
| 宿主被杀 | 149.5ms 检出,总停机 547.1ms,全部驻留会话中断 | 重挂载 41.3ms(30/30 试验),其他节点不受影响 |
| 提供者撤销 | 闭包卸载 0.263ms / 恢复 0.567ms | 显式报错 1.02ms,重挂载 80.28ms(10 试验) |
| 提供者重启 | 0.518ms,依赖者 10/10 重载 | 重挂载 94.5ms,调用方 10/10 未受扰 |
| 级联代价 | 每依赖者 50ms 串行恢复,20 个依赖者冻结 987ms | 一次进程启动 126.3ms,零冻结 |
| 远端资源离线 | 宿主崩溃 5/5,修复 1105ms | 节点存活 5/5,下一轮 107.8ms 恢复 |
| 驻留故障 | 宿主死亡 10/10,4/4 无辜会话被中断 | 仅故障节点 10/10,0/4 被中断 |
| 无故障 | makespan 24516ms | makespan 24722ms,差距 0.8% |
单进程配置的级联恢复在依赖者增多时线性恶化:5/10/20 个依赖者对应 250.9/501.5/1003.0ms,期间同一宿主里的无关会话整体冻结(20 依赖者时冻结 987.2ms)。而空闭包地板只有 0.263/0.567ms——说明单进程的换装优势只在组件不做任何实际工作时存在,一旦有真实加载工作就淹没在它必须执行的串行重执行里。
行为指标:自主采纳与并发
任务进行中新工具上线,模型在注册广播后 8.4 秒完成首次自主调用(提示词中没有点名该工具),三次此类采纳全部成功。三个 harness 共享一个工具、同时注入两故障(共享工具提供者与路由器一起被杀):2.8ms 检测、1 秒重挂载、模型自主采纳,故障窗口内 6 个中间结果被重算,两个故障会话各带两个错误但当场被捕获修复,最终全部正确。两个 harness 同时竞争工具时调用串行化通过 4.00 秒,每个应答回到自己的调用方,无误超时。
5.3 指标如何支撑主张
论文的核心主张是:跨进程的可靠性保证在理论与工程上都成立。恢复正确性指标(80 会话×4 击杀点零重复)直接验证定理的忠实性;尺度分离指标(0.215ms vs 177ms)验证部署前提;同故障对比把『单点故障』从定性抱怨变成定量定律——中断会话数就是驻留会话数,这是结构性后果而非测量趋势;0.8% 无故障差距则排除了性能差异的混淆解释。
六、效果优势的根源解释
6.1 单进程的根本局限在哪
不是『它没做隔离』这么简单。单进程架构把三样东西焊死在一起:故障域 = 事件循环 = 语言运行时。
- 事件循环串行化:所有依赖者的重装必须在共享事件循环上一个接一个重跑。这不是实现瑕疵,而是单线程宿主的物理结构——任何加载工作都占据唯一的执行通道,无关会话必然冻结。
- 错误传播无边界:一个组件连接远端资源失败,未处理的 rejection 穿透插件边界直达进程顶层,五个试验里五次杀死整个宿主。插件在数学上的隔离,在共享堆栈与共享异常通道面前不存在。
- 恢复即全栈重启:状态在进程内存里,进程死了状态就没了,唯一出路是从头再来,已完成步骤与记录的进度全部丢弃。
6.2 Logos 的根本性改变
Logos 不是把单进程的每个缺陷逐个打补丁,而是改变了三个约束的来源:
- 状态外置改变了恢复的物理基础。唯一共享状态是 append-only 转录,『先持久后可见』的结算顺序保证转录前缀永远包含恢复所需的一切锚点。于是恢复不再是『还原进程内存』(不可能),而是『任何进程读前缀到达相同宏状态』(定理归纳中装配步骤的核心论证)。这就是冷切换:进程从『状态的拥有者』降格为『可抛弃的辅助载体』——引理二的直接推论。
- 故障域切分到节点。一个组件的逆数据只在本进程(引理三),恢复是各进程任意交错的局部操作。远端资源离线时失败节点只是返回显式错误并继续活着——错误根本没有通道传到别的节点。同故障下 4/4 无辜会话被中断 vs 0/4,根源就在这里:故障的影响范围第一次由架构边界而非运气决定。
- 依赖解析变成数据。装配不是宿主里的代码路径,而是路由表里的行加广播。提供者下线触发的是重解析(同能力新提供者重绑依赖者),不是依赖树的拆除重跑。级联代价从『每依赖者 50ms 串行』变成『一次进程启动 126.3ms』。
6.3 因果链与反事实
完整因果链:插件即进程(引理三的物理化)→ 故障域=单节点、恢复数据局部化 → 同故障下无辜会话零中断、级联恢复与依赖者数量脱钩;转录外置(引理二)→ 状态存活与进程存活解耦 → 击杀点全周期覆盖的零重复恢复。
反事实检验论文自己也做了:若去掉持久转录,进程死亡即状态丢失,冷切换无从谈起;若去掉单写者强制(E2),同名注册会让路由表出现歧义指派,E1/E3 的配对与公共顺序也随之崩塌。0.8% 的无故障差距则说明这些收益不是用整体性能换来的。
6.4 诚实的边界
论文对自身的限制说得很清楚:路由器仍是单进程,其死亡虽把故障域收窄到路由变更窗口(中位 858ms 恢复,由监督轮询粒度决定),但仍是特殊节点;E1-E3 的失效语义(丢失、分区、重连)目前只有工程证据;部署边界限定可信网络;转录明文与单源是设计选择。未来工作是把每一项工程事实升级为形式化对应物。
七、必要知识反推
假设让一个完全没有背景的人重做这项工作,他最少需要知道什么?
7.1 领域知识层
- LLM agent harness 的实际构成:工具、中间件、会话、装配记录各是什么、怎么协作。不知道这些就无法识别『四项工程代价』,更不可能把故障域问题提炼成研究问题。
- 语言模型推理是无状态的这一工程事实——它是全部四个引理的 premises 之一。没有这个事实,跨步状态可能藏在模型内部,进程外置就没有理论基础。
- 单进程框架的真实痛点:事件循环、异常传播、单语言运行时的限制。这些来自对 AutoGen/LangGraph/MCP 生态的实操理解。
7.2 方法论知识层
- 时空可组合性演算:组件、track/recover、独立性、可靠性不变量、观测等价、注册表良构性。本文全部定理的砖石。特别要看出『不变量定义不涉及进程』这一结构性事实——这是跨进程通路的门缝。
- 抽象代数基础:幺半群与自由幺半群。引理二从『逆数据构成幺半群』推出 append-only 转录是最一般持久载体,没有这步推导,转录只是工程直觉而非数学必然。
- 分布式系统经典知识:故障域、消息路由、有损流与控制消息分层、背压与有界队列、至少一次投递与幂等。Logos 构造里每个工程决策都有这些经典问题的影子。
7.3 工程知识层
- 跨语言协议设计:NDJSON over TCP、64MB 帧上限、坏行跳过——让 Go/Python/Node.js 对等共存的最小公约数。
- 对抗性测试方法:四个击杀点的选取(工具调用周期的全部边界)、双盘源交叉核对、重放不变量 I1-I4 作为审计层。
- 受控对比设计:同一份会话代码、相同注入、相同判据,只变驻留形态;0.8% 无故障基线校准。
7.4 知识融合的关键节点
- 节点一(理论突破口):『可靠性不变量只住在状态空间』×『模型推理无状态』→ 载体可以替换、进程可以抛弃。这是演算知识与建模事实的化学反应,四个引理全部由此展开。
- 节点二(数学到工程的落点):『自由幺半群』→『JSONL 追加日志』。抽象代数的推论直接决定了文件的物理形态,罕见的理论与实现零缝隙案例。
- 节点三(架构移植):ROS 的对等进程与名字路由 × 演算的注册/广播语义 → 路由表=交换 key、注册=可逆效果。两个不相干领域的构件在 Logos 里咬合。
八、论文中可以提取的通用性灵感
灵感一:无状态内核 + 外部状态 = 部署自由
核心思想:只要计算核心是无状态的、状态显式外置,那么计算发生在哪里就完全不重要,可以自由分片、迁移、重启。
论文证据:引理一从『模型前向是无状态纯映射』直接推出模型成为普通可分发节点;冷切换在 80 会话×4 击杀点上全部成功。
推广场景:无服务器函数的冷启动优化;数据库连接池与计算节点分离;边缘计算中推理任务的任意调度;团队协作中『文档即状态、人是无状态 worker』的异步工作流。
灵感二:append-only 日志是可撤销性的数学最低载体
核心思想:任何需要撤销的操作序列,其最一般的持久记录形式就是只追加日志(自由幺半群),重放日志即恢复状态。
论文证据:引理二的推导链——逆数据幺半群 → 自由幺单群载体 → append-only 转录;『先持久后可见』的结算顺序保证转录前缀完整。
推广场景:事件溯源与 CQRS 架构;数据库 WAL;区块链的账本设计;协作软件的操作变换与 CRDT 历史;审计合规系统——任何『必须能解释系统如何走到当前状态』的场景。
灵感三:故障域应该由架构边界显式决定,而不是由运行时边界默认决定
核心思想:把所有东西放进一个进程,等于把故障域默认设置成『全部』;可靠性要求多少隔离,就应该用多少进程边界去实现。
论文证据:同故障对比中,宿主死亡 10/10 中断全部 4 个无辜会话 vs 对等构造 0/4;远端资源离线在单进程里变成宿主崩溃(5/5),在对等构造里只是一个节点的显式错误。
推广场景:浏览器多进程架构(一个标签页崩溃不影响其他);微服务的爆炸半径设计;嵌入式系统的隔离分区;组织架构——一个团队的故障不应传染整个公司。
灵感四:开销是否可接受,取决于和谁比(尺度分离论证)
核心思想:判断一项基础设施开销是否值得,不看绝对值,看它与所处系统主导开销的比例。
论文证据:总线跳 0.215ms 比本地调用贵 43 倍,但只是首 token 177ms 的 1/823——在模型时间尺度上不可见,这正是定理部署前提的实证。
推广场景:RPC vs 函数调用的架构决策;缓存层的引入判断;团队沟通成本的合理性(相对于交付周期);机器学习流水线中数据加载与训练时间的配比。
灵感五:把『组合本身』外包出去,而不只是执行
核心思想:大多数系统把干活的部分分布式化,但把『如何组装干活的部分』留在中心;把组合逻辑本身也外置成数据(路由表、广播事件),才能获得真正的热插拔。
论文证据:与 MCP/Temporal 的对比表——Logos 是唯一把组合与装配移出进程的框架;工具在任务中途上线后 8.4 秒被自主采纳,零代码改动。
推广场景:插件市场的动态发现与装配;编排引擎(如工作流 DSL 的运行时绑定);依赖注入容器的远程化;组织里的动态组队机制。
灵感六:进程应该是可抛弃的辅助载体
核心思想:如果状态与恢复数据都不依赖进程,进程就从『系统的主体』降格为『一次性的执行容器』,可以被随时杀死替换。
论文证据:冷切换的定义本身就是『进程是可抛弃的辅助载体』;12 会话 6 击杀、80 会话 4 击杀点全部无重复恢复;路由器死后节点靠直连继续跑完会话。
推广场景:容器编排的不可变基础设施哲学;混沌工程的标准实践;无状态微服务的弹性伸缩;职员轮岗制下的组织知识管理(知识在文档不在人脑)。
附录:一图总结 Logos
┌────────────────────────────┐
│ Router(Go,仅路由表) │
│ 注册 / 转发 / 广播 │
└──────┬─────────────────────┘
NDJSON over TCP │ 对等节点,无宿主语言限制
┌──────────┬─────────┼──────────┬───────────────┐
│ Harness │ Harness │ Tool(Py) │ Tool(Node.js) │
│ (Python) │ (Python)│ │ │
└────┬─────┴────┬────┴────┬─────┴───────────────┘
│ │ │
▼ ▼ ▼
┌────────────────────────────────┐
│ Append-only Transcript(JSONL) │ ← 唯一共享状态,不属于任何进程
│ 先持久后可见;重放重建会话 │
└────────────────────────────────┘
四个引理到构造部件的映射:模型为普通总线节点(引理一);转录与冷切换(引理二);能力为独立进程、恢复数据按进程(引理三);路由器只持路由表、注册为可逆效果(引理四)。
一篇把『数学允许』论证到『工程可行』再到『测量证实』的完整论文,对做 agent 基础设施的人来说,其四引理框架与尺度分离论证方法本身就值得收入工具箱。