← 返回
历史修改记录
登录

PI发布RTL Token 架构

ID: #760 权限: 🌍 公开 创建者: uid=1 历史版本: 0 条
📄 打开文档 ✏️ 编辑
v0 PI发布RTL Token 架构 🌍 公开 5 天前 by uid=1(admin)
内容变更(与上一版本对比) +3 -3
+ # PI发布RTL Token 架构
+
+ Physical Intelligence(π)的论文和官网。这里确实非常值得和你最近提出的 **S0/S1/S2 临时空间、QKV 空间映射、不要反复覆盖原信息**放在一起比较。
- 我重新查了 Physical Intelligence(π)的论文和官网。这里确实非常值得和你最近提出的 **S0/S1/S2 临时空间、QKV 空间映射、不要反复覆盖原信息**放在一起比较。
先纠正一个关键点:你说的 **RLT** 是 **RL Token**,论文题目是 *RL Token: Bootstrapping Online RL with Vision-Language-Action Models*;π 官网把它称为 **Precise Manipulation with Efficient Online RL**,核心不是一种全新的 VLA 主干,而是给已经训练好的 VLA 增加一个很小的 **RL Token 接口**,让在线强化学习可以在这个接口上工作。([Pi][1])
---
# 一、先把 π 的整体架构画出来
我认为最容易理解的是这一张:
```text
π 的世界模型 / 语义能力
│
┌────────────┴────────────┐
│ │
图像/视觉 语言
│ │
└────────────┬────────────┘
↓
┌─────────────┐
│ VLM │
│ │
│ 世界理解 │
│ 语言理解 │
│ 任务推理 │
└──────┬──────┘
│
共享表示/信息
│
┌────────────┼─────────────┐
↓ ↓ ↓
High-level RL Token Action Expert
│ │ │
│ ↓ ↓
│ Actor/Critic 连续动作
│
↓
子任务/意图
```
这其实已经非常接近你一直在寻找的:
> **不要让一个空间承担所有事情,而是把不同问题映射到不同空间。**
---
# 二、π0 最重要的创新:VLM 和动作生成分开
π0 并不是:
```text
图像
↓
Transformer
↓
动作
```
而是:
```text
图像
↓
┌─────────────┐
语言 → │ VLM │
状态 → │ │
└──────┬──────┘
│
共享语义表示
│
▼
┌──────────────┐
│ Action Expert│
└──────┬───────┘
│
Flow Matching
│
▼
连续动作
```
π 的论文把这个 Action Expert 看成类似 VLM 的“**运动皮层**”:VLM 保留互联网规模的视觉和语言知识,而 Action Expert 专门学习连续机器人控制。([Pi][2])
这点非常关键。
它实际上是在做:
> **知识空间 ≠ 动作空间。**
---
# 三、这和你提出的 S0/S1/S2 思路非常像
你之前的想法是:
```text
S0 = 原始输入
S1 = 从输入提取出来的信息
S2 = 第一次变换结果
S3 = 第二次变换结果
...
```
而不是:
```text
S = S + 新信息
S = S + 新信息
S = S + 新信息
```
因为不断相加可能导致:
> 新信息把旧信息覆盖、污染或者纠缠。
如果把 π 的架构抽象成你的语言,可以写成:
```text
S0
原始视觉 / 语言 / 状态
│
▼
S1
世界语义空间
│
├───────────────┐
↓ ↓
S2 S3
任务空间 动作空间
│
↓
Action
```
也就是说:
**π 并没有强迫“理解”和“控制”使用完全相同的输出机制。**
这就是它非常值得研究的地方。
---
# 四、π0.5 更进一步:不同类型的信息进入同一个 Transformer
π0.5 加入了更多异构数据:
```text
视觉
语言
机器人状态
物体检测
子任务
Web 数据
机器人动作
```
官方论文明确描述了这种 heterogeneous / hybrid multimodal training。([arXiv][3])
可以抽象成:
```text
┌── 图片
│
├── 语言
│
输入信息 ────────┼── 状态
│
├── 物体
│
└── 子任务
↓
Transformer
↓
┌──────┴──────┐
↓ ↓
High-level Low-level
↓
Action Expert
```
而这里有一个非常有意思的事情:
### 机器人状态甚至可以被“token 化”。
也就是:
```text
机器人状态
↓
离散 token
↓
Transformer
```
这样机器人身体状态就能进入原本用于处理语言/视觉信息的 attention 空间。([英特尔机器人人工智能套件][4])
---
-
- # 五、但真正和你“空间映射”理论最接近的是 RLT
… 内容过长,仅显示前 200 行 …
v-1 PI发布RTL Token 架构 🌍 公开 5 天前 by uid=1(admin)
内容变更(与上一版本对比) 初始版本
这是最早的历史记录(无前一版本可对比)