# OraRL
### 将标注作为 Rollout
**面向统一视频多模态大模型的高效、可扩展强化学习**
Yunheng Li · Guohong Mu · Hao Li · Shengsheng Qian · Dingwen Zhang ·
Qibin Hou · Ming-Ming Cheng
📄 论文
·
🌐 项目主页
·
🤗 模型(4B / 9B)
⚙️ 环境
·
🚀 训练
·
📊 评测
·
⚖️ 许可证
**▶ 点击图片观看 1 分 38 秒的项目介绍视频。**
## 为什么选择 OraRL
- **将标注作为 Rollout:** 将标注转化为可靠的正样本 rollout,同时策略样本
仍使用纯 on-policy 基线。
- **七类任务统一训练:** 同一套更新规则覆盖时序定位、空间定位、分割、跟踪、
时空定位、视频问答和空间智能。
- **高效训练(4B):** 符号均衡剪枝带来 **1.48× 的更新加速**
(**92.5 → 62.4 秒/步**),同时将单卡峰值显存从 **62.4 GB 降至
50.9 GB**。
- **高效推理:** 在单张 H20 上使用 vLLM 和 BF16 时,权重加载占用分别为
**8.6 GiB(4B)**和 **17.6 GiB(9B)**。对于 2 fps 采样的十分钟视频,
仅生成答案将首 token 后的中位延迟从 **4.78 秒降至 130 毫秒**,并将总
中位延迟从 **29.03 秒降至 24.30 秒**。
- **多模态 veRL 基础设施:** 统一的视频数据契约支持缓存产物、原始路径和内联
帧张量,并贯通 vLLM rollout 与 FSDP 更新;同时加入单次解码帧复用、时序
元数据、按任务分组的批处理、异步 Ray 奖励和安全的混合引擎缓存处理。
## 一次 OraRL 更新