PI发布RTL Token 架构
Physical Intelligence(π)的论文和官网。这里确实非常值得和你最近提出的 S0/S1/S2 临时空间、QKV 空间映射、不要反复覆盖原信息放在一起比较。
先纠正一个关键点:你说的 RLT 是 RL Token,论文题目是 RL Token: Bootstrapping Online RL with Vision-Language-Action Models;π 官网把它称为 Precise Manipulation with Efficient Online RL,核心不是一种全新的 VLA 主干,而是给已经训练好的 VLA 增加一个很小的 RL Token 接口,让在线强化学习可以在这个接口上工作。(Pi)
一、先把 π 的整体架构画出来
我认为最容易理解的是这一张:
π 的世界模型 / 语义能力
│
┌────────────┴────────────┐
│ │
图像/视觉 语言
│ │
└────────────┬────────────┘
↓
┌─────────────┐
│ VLM │
│ │
│ 世界理解 │
│ 语言理解 │
│ 任务推理 │
└──────┬──────┘
│
共享表示/信息
│
┌────────────┼─────────────┐
↓ ↓ ↓
High-level RL Token Action Expert
│ │ │
│ ↓ ↓
│ Actor/Critic 连续动作
│
↓
子任务/意图
这其实已经非常接近你一直在寻找的:
不要让一个空间承担所有事情,而是把不同问题映射到不同空间。
二、π0 最重要的创新:VLM 和动作生成分开
π0 并不是:
图像
↓
Transformer
↓
动作
而是:
图像
↓
┌─────────────┐
语言 → │ VLM │
状态 → │ │
└──────┬──────┘
│
共享语义表示
│
▼
┌──────────────┐
│ Action Expert│
└──────┬───────┘
│
Flow Matching
│
▼
连续动作
π 的论文把这个 Action Expert 看成类似 VLM 的“运动皮层”:VLM 保留互联网规模的视觉和语言知识,而 Action Expert 专门学习连续机器人控制。(Pi)
这点非常关键。
它实际上是在做:
知识空间 ≠ 动作空间。
三、这和你提出的 S0/S1/S2 思路非常像
你之前的想法是:
S0 = 原始输入
S1 = 从输入提取出来的信息
S2 = 第一次变换结果
S3 = 第二次变换结果
...
而不是:
S = S + 新信息
S = S + 新信息
S = S + 新信息
因为不断相加可能导致:
新信息把旧信息覆盖、污染或者纠缠。
如果把 π 的架构抽象成你的语言,可以写成:
S0
原始视觉 / 语言 / 状态
│
▼
S1
世界语义空间
│
├───────────────┐
↓ ↓
S2 S3
任务空间 动作空间
│
↓
Action
也就是说:
π 并没有强迫“理解”和“控制”使用完全相同的输出机制。
这就是它非常值得研究的地方。
四、π0.5 更进一步:不同类型的信息进入同一个 Transformer
π0.5 加入了更多异构数据:
视觉
语言
机器人状态
物体检测
子任务
Web 数据
机器人动作
官方论文明确描述了这种 heterogeneous / hybrid multimodal training。(arXiv)
可以抽象成:
┌── 图片
│
├── 语言
│
输入信息 ────────┼── 状态
│
├── 物体
│
└── 子任务
↓
Transformer
↓
┌──────┴──────┐
↓ ↓
High-level Low-level
↓
Action Expert
而这里有一个非常有意思的事情:
机器人状态甚至可以被“token 化”。
也就是:
机器人状态
↓
离散 token
↓
Transformer
这样机器人身体状态就能进入原本用于处理语言/视觉信息的 attention 空间。(英特尔机器人人工智能套件)
五、但真正和你“空间映射”理论最接近的是 RLT
这是我认为最值得你关注的部分。
RLT 的核心是:
从已经训练好的巨大 VLA 中,抽取一个紧凑的 RL Token。
然后:
π0.6
│
│
┌─────┴─────┐
│ │
↓ ↓
原来的策略 RL Token
│
↓
Actor-Critic
│
↓
新动作
论文强调,这个 RL Token 是一个紧凑的 readout representation,保留预训练 VLA 中与任务有关的知识,同时作为在线 RL 的高效接口。(alphaXiv)
六、这实际上就是“不要重新训练整个空间”
如果没有 RLT,传统思路可能是:
巨大 VLA
↓
强化学习
↓
整个模型继续调整
问题:
计算贵
数据贵
容易破坏原来的能力
RLT 变成:
巨大 VLA
│
│ 冻结/尽量保持
│
▼
RL Token
│
▼
小型 Actor-Critic
│
▼
针对具体任务优化
这和你之前说的:
不要改变原来的 S0,而是在另一个空间 S1/S2 中增加信息。
是高度相似的设计哲学。
七、甚至可以把 RLT 理解成“接口空间”
这是我认为最值得你进一步研究的地方。
普通 Transformer:
输入
↓
大量层
↓
输出
你的想法:
S0
↓
S1
↓
S2
↓
S3
↓
组合
而 RLT 可以理解成:
巨大的知识空间
│
│ projection
↓
┌───────────┐
│ RL Token │
└─────┬─────┘
│
┌─────────┴─────────┐
↓ ↓
Actor Critic
│ │
↓ ↓
Action Value
因此:
RL Token 不是简单的“一个 token”,而更像一个任务专用的接口空间。
它把:
“庞大的通用知识”
和
“很小的任务优化问题”
隔离开。
八、这与你之前对 QKV 的理解也能接上
你之前提出:
QKV 不一定只是“从一堆 token 中找东西”,还可以理解成把问题映射到一个临时空间,在那里寻找相关信息,然后再回到原空间。
如果这么看:
原空间 S0
│
│ Query
↓
相关信息空间
│
│ Attention
↓
重新组合
│
↓
S0'
而 RLT:
VLA知识空间
│
│ readout / projection
↓
RL Token
│
│ RL
↓
任务策略
它们共同体现一种架构思想:
不要让所有计算都发生在原始空间。
九、甚至可以把它们统一成一个模型
我觉得你现在的理论可以进一步抽象成:
“空间不是越少越好,而是要让每个空间承担合适的问题。”
例如:
原始世界
│
▼
┌──────────────┐
S0 │ 原始观察空间 │
└──────┬───────┘
│
▼
┌──────────────┐
S1 │ 语义理解空间 │
└──────┬───────┘
│
┌──────┴─────────┐
↓ ↓
S2 任务规划空间 S3 动作空间
│ │
↓ ↓
子任务 Action
│
└───────┐
↓
现实世界
│
↓
Feedback
│
↓
S4
学习空间
这比:
所有东西
↓
一个超级大的 Transformer
↓
一个输出
更容易解释很多现代 AI 架构为什么不断出现:
- Adapter
- LoRA
- Expert
- Memory
- Tool
- Latent space
- Action head
- RL Token
- Value head
它们本质上都可能是在做:
把不同性质的问题放到不同的表示空间/计算接口中。
十、π 其实已经走到了“多空间”架构
截至现在,π 的路线已经不仅仅是 π0 → π0.5 → π0.6。
还有:
π0.6
增加更强的 VLA 能力,并通过 Recap 从机器人实际经验中学习。π*0.6 的训练流程包含离线 RL、示范微调、真实机器人经验和人工纠正。(Pi)
MEM
2026 年 3 月,π 又发布了长短期记忆架构。
它明确把:
短期记忆 = 原始观察
长期记忆 = 抽象的自然语言概念
分开保存。模型还会主动决定记住什么、怎么记。(Pi)
这个和你之前的:
S0、S1、S2……不要全部揉成一个空间
其实又非常接近。
RLT
再增加:
VLA
↓
RL Token
↓
小型 RL 模块
π0.7
2026 年 4 月又发布了 π0.7,标题直接叫 A Steerable Model with Emergent Capabilities。(Pi)
十一、所以我现在反而觉得,你之前的“临时空间”想法可以重新定义
不要把它叫:
多层空间
我觉得可以叫:
任务专用表示空间(Task-specific Representation Space)
核心原则:
$$ S_{i+1}=F_i(S_i) $$
但是关键不是:
$$ S_{i+1}=S_i+\Delta $$
而是:
$$ S_i \xrightarrow{\;Projection_i\;} X_i \xrightarrow{\;Computation_i\;} Y_i \xrightarrow{\;Projection^{-1}_i\;} S_{i+1} $$
也就是:
原空间
↓
映射
↓
临时问题空间
↓
在最合适的空间解决问题
↓
映射回来
这正好对应你之前说的:
A → B 很困难,就找一个 X。
十二、我认为真正有意思的差别
不过要特别注意:
不能说“π 的 RLT 就证明了你的架构理论”。
目前最多只能说,两者出现了非常有意思的架构同构思想:
| 你的思路 | π 系统中的对应 |
|---|---|
| S0 原始空间 | 视觉/语言/机器人状态 |
| S1 语义空间 | VLM 表示 |
| 临时空间 X | Action Expert / RL Token |
| 空间映射 | projection / attention / readout |
| 不污染原空间 | VLA 保留预训练能力 |
| 专门空间解决专门问题 | Action Expert / Actor-Critic |
| 新信息单独保存 | MEM |
| 反馈回流 | RL |
| 最后产生现实动作 | VLA action |
所以真正值得继续研究的不是:
“我的想法是不是和 π 一样?”
而是更进一步的问题:
能不能把“不同问题进入不同计算空间”发展成一种通用的 AI 架构原则?
这和你之前研究 S0/S1/S2、QKV、StructNN、PatternNN 的思路其实可以串起来了。
尤其值得做一个实验:
普通 Transformer
VS
空间分离 Transformer
VS
空间分离 + RL Token
VS
空间分离 + Memory
然后拿一个很小的任务,例如你之前的 1+2、Hello→你好、交通堵塞、蘑菇采摘,测试“信息是否被覆盖”“新知识是否干扰旧知识”“任务切换是否更稳定”。
如果这个实验成立,你就不只是对 π 做解释,而是在形成你自己的架构设计原则。