←

PI发布RTL Token 架构

📄 文章 🌐 公开 👁 10 次
📋 列表 ✏️ 编辑 🎨 画布版 📋 复制MD 🌐 复制HTML ☆ 收藏 🔗 复制链接

PI发布RTL Token 架构

Physical Intelligence(π)的论文和官网。这里确实非常值得和你最近提出的 S0/S1/S2 临时空间、QKV 空间映射、不要反复覆盖原信息放在一起比较。

先纠正一个关键点:你说的 RLT 是 RL Token,论文题目是 RL Token: Bootstrapping Online RL with Vision-Language-Action Models;π 官网把它称为 Precise Manipulation with Efficient Online RL,核心不是一种全新的 VLA 主干,而是给已经训练好的 VLA 增加一个很小的 RL Token 接口,让在线强化学习可以在这个接口上工作。(Pi)


一、先把 π 的整体架构画出来

我认为最容易理解的是这一张:

                    π 的世界模型 / 语义能力
                           │
              ┌────────────┴────────────┐
              │                         │
           图像/视觉                  语言
              │                         │
              └────────────┬────────────┘
                           ↓
                    ┌─────────────┐
                    │     VLM     │
                    │             │
                    │ 世界理解     │
                    │ 语言理解     │
                    │ 任务推理     │
                    └──────┬──────┘
                           │
                    共享表示/信息
                           │
              ┌────────────┼─────────────┐
              ↓            ↓             ↓
          High-level    RL Token     Action Expert
              │            │             │
              │            ↓             ↓
              │         Actor/Critic   连续动作
              │
              ↓
           子任务/意图

这其实已经非常接近你一直在寻找的:

不要让一个空间承担所有事情,而是把不同问题映射到不同空间。


二、π0 最重要的创新:VLM 和动作生成分开

π0 并不是:

图像
 ↓
Transformer
 ↓
动作

而是:

             图像
              ↓
        ┌─────────────┐
语言 →  │     VLM     │
状态 →  │             │
        └──────┬──────┘
               │
          共享语义表示
               │
               ▼
        ┌──────────────┐
        │ Action Expert│
        └──────┬───────┘
               │
        Flow Matching
               │
               ▼
          连续动作

π 的论文把这个 Action Expert 看成类似 VLM 的“运动皮层”:VLM 保留互联网规模的视觉和语言知识,而 Action Expert 专门学习连续机器人控制。(Pi)

这点非常关键。

它实际上是在做:

知识空间 ≠ 动作空间。


三、这和你提出的 S0/S1/S2 思路非常像

你之前的想法是:

S0 = 原始输入
S1 = 从输入提取出来的信息
S2 = 第一次变换结果
S3 = 第二次变换结果
...

而不是:

S = S + 新信息
S = S + 新信息
S = S + 新信息

因为不断相加可能导致:

新信息把旧信息覆盖、污染或者纠缠。

如果把 π 的架构抽象成你的语言,可以写成:

S0
原始视觉 / 语言 / 状态
       │
       ▼
S1
世界语义空间
       │
       ├───────────────┐
       ↓               ↓
S2                    S3
任务空间              动作空间
                       │
                       ↓
                    Action

也就是说:

π 并没有强迫“理解”和“控制”使用完全相同的输出机制。

这就是它非常值得研究的地方。


四、π0.5 更进一步:不同类型的信息进入同一个 Transformer

π0.5 加入了更多异构数据:

视觉
语言
机器人状态
物体检测
子任务
Web 数据
机器人动作

官方论文明确描述了这种 heterogeneous / hybrid multimodal training。(arXiv)

可以抽象成:

                ┌── 图片
                │
                ├── 语言
                │
输入信息 ────────┼── 状态
                │
                ├── 物体
                │
                └── 子任务
                     ↓
                 Transformer
                     ↓
              ┌──────┴──────┐
              ↓             ↓
           High-level    Low-level
                            ↓
                       Action Expert

而这里有一个非常有意思的事情:

机器人状态甚至可以被“token 化”。

也就是:

机器人状态
    ↓
离散 token
    ↓
Transformer

这样机器人身体状态就能进入原本用于处理语言/视觉信息的 attention 空间。(英特尔机器人人工智能套件)


五、但真正和你“空间映射”理论最接近的是 RLT

这是我认为最值得你关注的部分。

RLT 的核心是:

从已经训练好的巨大 VLA 中,抽取一个紧凑的 RL Token。

然后:

                  π0.6
                    │
                    │
              ┌─────┴─────┐
              │           │
              ↓           ↓
         原来的策略      RL Token
                          │
                          ↓
                     Actor-Critic
                          │
                          ↓
                      新动作

论文强调,这个 RL Token 是一个紧凑的 readout representation,保留预训练 VLA 中与任务有关的知识,同时作为在线 RL 的高效接口。(alphaXiv)


六、这实际上就是“不要重新训练整个空间”

如果没有 RLT,传统思路可能是:

巨大 VLA
 ↓
强化学习
 ↓
整个模型继续调整

问题:

计算贵
数据贵
容易破坏原来的能力

RLT 变成:

巨大 VLA
   │
   │ 冻结/尽量保持
   │
   ▼
RL Token
   │
   ▼
小型 Actor-Critic
   │
   ▼
针对具体任务优化

这和你之前说的:

不要改变原来的 S0,而是在另一个空间 S1/S2 中增加信息。

是高度相似的设计哲学。


七、甚至可以把 RLT 理解成“接口空间”

这是我认为最值得你进一步研究的地方。

普通 Transformer:

输入
 ↓
大量层
 ↓
输出

你的想法:

S0
 ↓
S1
 ↓
S2
 ↓
S3
 ↓
组合

而 RLT 可以理解成:

              巨大的知识空间
                    │
                    │ projection
                    ↓
              ┌───────────┐
              │ RL Token  │
              └─────┬─────┘
                    │
          ┌─────────┴─────────┐
          ↓                   ↓
       Actor                Critic
          │                   │
          ↓                   ↓
        Action             Value

因此:

RL Token 不是简单的“一个 token”,而更像一个任务专用的接口空间。

它把:

“庞大的通用知识”

和

“很小的任务优化问题”

隔离开。


八、这与你之前对 QKV 的理解也能接上

你之前提出:

QKV 不一定只是“从一堆 token 中找东西”,还可以理解成把问题映射到一个临时空间,在那里寻找相关信息,然后再回到原空间。

如果这么看:

原空间 S0
   │
   │ Query
   ↓
相关信息空间
   │
   │ Attention
   ↓
重新组合
   │
   ↓
S0'

而 RLT:

VLA知识空间
      │
      │ readout / projection
      ↓
   RL Token
      │
      │ RL
      ↓
任务策略

它们共同体现一种架构思想:

不要让所有计算都发生在原始空间。


九、甚至可以把它们统一成一个模型

我觉得你现在的理论可以进一步抽象成:

“空间不是越少越好,而是要让每个空间承担合适的问题。”

例如:

             原始世界
                │
                ▼
        ┌──────────────┐
S0      │ 原始观察空间 │
        └──────┬───────┘
               │
               ▼
        ┌──────────────┐
S1      │ 语义理解空间 │
        └──────┬───────┘
               │
        ┌──────┴─────────┐
        ↓                ↓
S2 任务规划空间       S3 动作空间
        │                │
        ↓                ↓
      子任务           Action
        │
        └───────┐
                ↓
             现实世界
                │
                ↓
              Feedback
                │
                ↓
               S4
             学习空间

这比:

所有东西
 ↓
一个超级大的 Transformer
 ↓
一个输出

更容易解释很多现代 AI 架构为什么不断出现:

  • Adapter
  • LoRA
  • Expert
  • Memory
  • Tool
  • Latent space
  • Action head
  • RL Token
  • Value head

它们本质上都可能是在做:

把不同性质的问题放到不同的表示空间/计算接口中。


十、π 其实已经走到了“多空间”架构

截至现在,π 的路线已经不仅仅是 π0 → π0.5 → π0.6。

还有:

π0.6

增加更强的 VLA 能力,并通过 Recap 从机器人实际经验中学习。π*0.6 的训练流程包含离线 RL、示范微调、真实机器人经验和人工纠正。(Pi)

MEM

2026 年 3 月,π 又发布了长短期记忆架构。

它明确把:

短期记忆 = 原始观察
长期记忆 = 抽象的自然语言概念

分开保存。模型还会主动决定记住什么、怎么记。(Pi)

这个和你之前的:

S0、S1、S2……不要全部揉成一个空间

其实又非常接近。

RLT

再增加:

VLA
 ↓
RL Token
 ↓
小型 RL 模块

π0.7

2026 年 4 月又发布了 π0.7,标题直接叫 A Steerable Model with Emergent Capabilities。(Pi)


十一、所以我现在反而觉得,你之前的“临时空间”想法可以重新定义

不要把它叫:

多层空间

我觉得可以叫:

任务专用表示空间(Task-specific Representation Space)

核心原则:

$$ S_{i+1}=F_i(S_i) $$

但是关键不是:

$$ S_{i+1}=S_i+\Delta $$

而是:

$$ S_i \xrightarrow{\;Projection_i\;} X_i \xrightarrow{\;Computation_i\;} Y_i \xrightarrow{\;Projection^{-1}_i\;} S_{i+1} $$

也就是:

原空间
  ↓
映射
  ↓
临时问题空间
  ↓
在最合适的空间解决问题
  ↓
映射回来

这正好对应你之前说的:

A → B 很困难,就找一个 X。


十二、我认为真正有意思的差别

不过要特别注意:

不能说“π 的 RLT 就证明了你的架构理论”。

目前最多只能说,两者出现了非常有意思的架构同构思想:

你的思路 π 系统中的对应
S0 原始空间 视觉/语言/机器人状态
S1 语义空间 VLM 表示
临时空间 X Action Expert / RL Token
空间映射 projection / attention / readout
不污染原空间 VLA 保留预训练能力
专门空间解决专门问题 Action Expert / Actor-Critic
新信息单独保存 MEM
反馈回流 RL
最后产生现实动作 VLA action

所以真正值得继续研究的不是:

“我的想法是不是和 π 一样?”

而是更进一步的问题:

能不能把“不同问题进入不同计算空间”发展成一种通用的 AI 架构原则?

这和你之前研究 S0/S1/S2、QKV、StructNN、PatternNN 的思路其实可以串起来了。

尤其值得做一个实验:

普通 Transformer
       VS
空间分离 Transformer
       VS
空间分离 + RL Token
       VS
空间分离 + Memory

然后拿一个很小的任务,例如你之前的 1+2、Hello→你好、交通堵塞、蘑菇采摘,测试“信息是否被覆盖”“新知识是否干扰旧知识”“任务切换是否更稳定”。

如果这个实验成立,你就不只是对 π 做解释,而是在形成你自己的架构设计原则。

💬 留言 ⋮⋮

加载中…
💡 不登录也可留言(IP 限制:每文/每天各 1/10 条)

加载中…

分 0.00
纸张白
护眼绿
羊皮卷
夜间黑
100%