虎科技
业界资讯 手机产品 数码产品 移动互联 软件产品 智能汽车 生活家电 关于我们 热点资讯

大晓机器人携手港大推出StreamPI,为机器人时序理解开启时空智能新篇

2026-08-28来源:互联网编辑:瑞雪

在机器人技术领域,大晓机器人与香港大学联合发布了一项名为StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models)的全新研究成果,这一突破性进展为解决视觉-语言-动作模型(VLA)长期存在的“单帧智能”瓶颈提供了关键方案,成功为VLA补上了至关重要的“时间维度”。

传统VLA主要依据当前观测进行独立决策,这种“单帧智能”模式限制了机器人的能力。而StreamPI则为模型构建了持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,还能利用跨帧信息增强精细空间感知与动作决策能力。它推动VLA从单纯“识别当前状态”,迈向“理解正在发生的物理过程”,让机器人对世界的认知从静态画面转变为动态的时间流。

在技术实现上,StreamPI并未采用依赖额外参数堆叠来获取时序能力的方式,而是基于现有的VLA骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现了从单帧决策到连续时序建模的轻量化扩展。这种创新方法避免了因参数堆叠带来的复杂问题,同时保证了模型的高效运行。

真实机器人实验以及在LIBERO、CALVIN等实验环境中的测试结果显示,StreamPI在时序记忆、精细空间操作与长程连续任务等方面取得了显著提升。以“猜杯子”任务为例,物体被藏入杯子并经过多次交换后,答案存在于整个变化过程而非最后一帧,传统单帧决策的机器人难以应对,而StreamPI赋能的机器人能凭借对历史信息的理解准确判断。在滚动物体场景中,单帧只能确定物体位置,连续观测才能理解其运动趋势,StreamPI让机器人真正理解了“物体正往哪里去”。

在给VLA加入时间信息的方法上,以往简单将过去多帧图像组成窗口一次性交给模型的方式存在诸多弊端。历史帧越多,视觉信息量越大,不仅需要反复计算已处理画面,增加推理开销,还易使任务指令被大量视觉信息稀释,导致机器人在长程执行中“忘记目标”。

StreamPI则采用了更科学的方法,它将每个时刻组织为“视觉观测 + 任务指令”的完整时序单元。语言指令持续绑定每次观测,成为贯穿任务始终的语义锚点,让机器人在接收新信息时始终明确目标。在时序单元内部,视觉与语言充分交互;不同单元之间按时间顺序持续读取和聚合历史信息,使模型既能理解当下所见,又能追溯过去发生的事,将离散的单帧判断连接成连续的时序理解。

为了让机器人拥有记忆的同时避免重复计算历史,StreamPI采用流式推理。首帧观测编码后存入键值缓存,后续只需处理新信息并调用历史表示,避免了重复计算整个观测窗口。而且,StreamPI无需额外引入视频编码器或独立记忆模块,通过重构原有VLA的注意力机制,直接继承π0.5的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧VLA获得连续时序能力。

真实机器人的运行环境复杂,相机采集、模型推理、通信与机械臂执行等环节都会产生延迟,导致观测时间波动,只在固定间隔数据上训练的模型在部署时易遭遇时序分布差异。为此,StreamPI引入随机时间间隔训练,随机改变历史观测间的时间距离并隐藏部分早期信息,让模型适应不同时间跨度和不完整上下文,学习更稳定的时序关系。

实验数据充分证明了StreamPI的有效性。在LIBERO上,随机时间间隔训练策略将三帧输入时的平均成功率从96.4%提升至97.5%,五帧输入时从97.0%提升至98.3%。在更依赖长程上下文的LIBERO - Long任务中,成功率从π0.5的92.4%提升至95.0%。在CALVIN上,StreamPI平均连续任务长度达到4.547,超过π0.5的4.313和MemoryVLA的4.090;任务推进到第五步时,成功率仍达85.0%,高于π0.5的79.5%。

团队还设计了四项真机任务检验StreamPI的时序记忆与精细空间感知能力,每项任务采集100条人类遥操作示范。在“猜杯子”任务中,StreamPI将π0.5的成功率从46.7%提升至80.0%;在滚动物体抓取任务中,从26.7%提升至63.3%。在强调空间精度的窄瓶口插笔任务中,成功率从40.0%提升至66.7%;纸杯插入杯套任务则从60.0%提升至92.0%。这些数据表明,时间不仅为机器人带来记忆,还帮助它更准确地理解空间。

StreamPI的出现,标志着机器人从基于当前状态决策迈向基于连续过程决策的重要转变。它让机器人对现实世界的认知不再局限于彼此孤立的静态画面,而是能够记忆、理解和持续更新时间流中的信息。目前,StreamPI在超长时间跨度训练和极端异步场景下仍有提升空间,但它的探索为机器人技术的发展开辟了新的道路,推动具身基础模型从空间智能向真正面向动态物理世界的时空智能迈进。

智元机器人世界人形机器人运动会夺魁,具身智能迈向新高度
所以,对于机器人来说,这就要求它们拥有一个足够聪明的“大脑”以及与之配对的“身体”,这也是为什么智元会选择自己解决“一体三智”的原因,只有原生匹配的“大脑”和“身体”,才能在复杂的环境下适应各种工作和应付突发…

2026-08-28

苹果发布会Logo藏玄机?iPhone 18 Pro或迎新配色与相机系统大升级
此前,外界已经多次传出苹果计划为iPhone引入可变光圈摄像头,而如果这一功能最终落地,将成为苹果手机影像系统的一项重要变化。如果苹果iPhone 18 Pro Max采用机械可变光圈方案,用户未来可能能够…

2026-08-28

索尼WH-CH730N无线耳机提前上架欧洲市场:5色可选,重220克或10月开售
IT之家 8 月 27 日消息,科技媒体 NotebookCheck 昨日(8 月 26 日)发布博文,报道称多家欧洲电商平台已偷跑上架索尼WH-CH730N 无线头戴式耳机,预估将提供 5 种颜色,标价在…

2026-08-28

古尔曼解读苹果邀请函:iPhone 18 Pro系列或迎可变光圈与天蓝色新配色
彭博社记者马克·古尔曼对邀请函进行解读,认为其中暗藏了iPhone 18 Pro系列的两大核心卖点。邀请函主视觉采用天蓝色渐变背景,古尔曼认为这是在暗示iPhone 18 Pro系列将新增天蓝色配色,色调接…

2026-08-28

Arm首款自研AGI CPU架构揭秘:双芯粒设计,超千亿晶体管赋能AI智能体
在核心配置上,AGI CPU每个芯粒物理上搭载70个Neoverse V3核心,但各有4个核心被屏蔽以提升良率,因此单颗处理器最多启用136个核心,每核心配备2MB配备L2缓存,最高运行频率达3.7GHz,…

2026-08-27

苹果入局折叠屏市场或重塑格局,iPhone Ultra首年出货预估超千万台
在 IDC 报告中,该机构认为在苹果入局折叠手机后,助推全球折叠手机市场快速增长,预估 2026 年折叠屏手机市场达到 2290万部,同比增长 12.6%;预估 2027 年达到 2700 万部,同比增长…

2026-08-27

明基推出Creative Pro PV50系列专业显示器,为视频后期制作带来精准色彩新体验
IT之家 8 月 27 日消息,明基 (BenQ) 英国当地时间 25 日宣布推出 Creative Pro PV50系列专业显示器,除国行先行发售的 32" 型号 PV3250U 外还提供了同样采用 UH…

2026-08-27

9月新机潮来袭!vivo X500系列三杯齐发,iQOO 16与小平板同期亮相
IT之家 8 月 27 日消息,博主 @数码闲聊站 今日爆料,vivo X500 系列 9 月三杯齐发,大概率是最早发布的国产直板旗舰,Pro系列首发 2nm 天玑 9600 Pro。此外,该机还搭载 X3…

2026-08-27