
HALOMI: Learning Humanoid Loco-Manipulation with Active Perception from Human Demonstrations
提出一种可扩展框架,通过第一视角人类示范学习稳健的人形机器人移动操作能力,并结合主动感知与精确的头部—双手轨迹跟踪。


FSAG: Enhancing Human-to-Dexterous-Hand Finger-Specific Affordance Grounding via Diffusion Models
提出一种数据高效框架,利用预训练生成式扩散模型中蕴含的丰富、以物体为中心的语义先验,从而绕过机器人抓取数据的采集过程。

SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks
提出 SAGE——一种面向长时程操作任务、具备场景图感知能力的引导与执行新框架。

提出一种基于高斯泼溅(Gaussian Splatting)的无监督多视角立体视觉系统——低光高斯泼溅,用于纯黑暗环境下的图像增强与重建。

Meta-Scoop: A Coarse-to-Precise Policy Learning Framework for Precision Scooping Across Task Variations
提出一种由粗到精的策略学习框架,在多种任务变化下实现精确的舀取操作。

Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation
提出 Triplet-to-Track 系统(TTS)——一种闭环长时程模仿学习系统,利用人类视频演示降低对机器人采集数据的依赖。