具身智能观察

具身智能 · 每周资讯

自动聚合技术与商业前沿,共收录 24 条精选内容

学术论文arXiv2026-08-13

S2-HWM: Sparse Event-Structured Hierarchical World Model for Long-Horizon Surgical Robot Manipulation

提出层次世界模型S2-HWM,提升手术机器人长时程操作成功率至98.7%。

  • S2-HWM采用稀疏事件结构化层次世界模型,协调事件级管理与原始步控制。
  • 事件证据形成变时长片段,事件转移模型预测状态、时长和奖励,扩展想象时域。
  • 在SurRoL PegTransfer任务中成功率达98.7%,比DreamerV3基线高22.7个百分点。
学术论文arXiv2026-08-13

H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models

提出H2R-Bench基准评估人机操作视频生成的跨具身迁移能力。

  • H2R-Bench用于评估从人类第一视角演示到机器人操作视频的跨具身生成能力。
  • 基准覆盖目标状态完成、动作事件完成、功能接触迁移、具身正确性和视频质量五个维度。
  • 对11个视频生成模型在六类操作任务和两种机器人本体上的评测显示当前模型仍有明显局限。
学术论文雷锋网2026-08-13

给黑盒导航机器人「使绊子」:AdvNav 如何揭示具身智能系统潜在安全风险 | GAIR Paper 117

AdvNav揭示视觉语言导航黑盒脆弱性,实现高效攻击

  • AdvNav为首个面向VLN的黑盒行为引导对抗攻击框架,无需访问模型参数或梯度
  • 通过双粒度反馈机制和遗传算法优化扰动,在有限查询预算下实现高效攻击
  • 在R2R数据集上对HAMT和MapGPT攻击成功率分别达49.70%、65.96%和87.30%,揭示视觉脆弱性
学术论文arXiv2026-08-13

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

人形机器人视觉语言导航物理仿真基准HumanoidVLN发布。

  • 基于NVIDIA Isaac Sim构建,支持Unitree G1/H1及Internal-A/B四种人形机器人,身高1.17-1.80米。
  • 生成933条碰撞感知参考路径指令,每条配有细粒度指令及正式、自然、随意三种风格变体。
  • 四个模型中JanusVLN成功率最高达43.55%,sim-to-real导航误差相关系数r=0.935。
学术论文arXiv2026-08-12

D3D-GEN: Robot-Aware Domain-Grounded Interactive 3D World Generation for Social Robotics

D3D-GEN自动生成社交机器人训练用真实可交互3D世界

  • 结合领域智能体与检索增强生成管线,自动收集领域知识并生成真实平面图和物体布局
  • 无需依赖固定3D模型数据库,可通过用户提供的语义数据库动态查询并易于扩展
  • 输出兼容Isaac Sim和Gazebo的完全可交互3D环境,已构建住宅、医院、办公室等领域数据库
学术论文arXiv2026-08-12

Adaptation of Generalist Robot Policies with Minimal Data

提出MiDAS方法,让预训练VLA从单次演示和在线交互中适应新任务。

  • MiDAS结合少量演示行为克隆与在线强化学习,仅需一次演示即可适应新任务。
  • 在LIBERO、RoboCasa及双臂YAM平台验证,显著优于基线并泛化到未演示条件。
  • 首次展示从单一任务演示实现可靠机器人策略适应,约6小时在线交互提升鲁棒性。
学术论文arXiv2026-08-12

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

提出手术世界-动作模型,利用无动作视频预训练提升手术机器人数据效率。

  • 提出统一生成式模型 Surgical WAM,基于 Cosmos Policy 联合预测内窥镜未来观测和可执行动作块。
  • 先用无动作视频学习手术视觉动态,再用固定量动作标注数据微调,部署时为闭环滚动时域控制器。
  • 在四个模拟手术任务上,视频预训练将平均成功率从63.5%提升至77.8%,接触丰富和双臂任务收益最大。
学术论文arXiv2026-08-11

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks

提出面向织物拆垛的顶层面料分割架构,提升机器人操作精度。

  • 针对叠放织物顶层分割难题,提出边缘感知与形状感知分支的多分支编码器-解码器架构
  • 边缘感知分支增强边界划分,形状感知分支利用CAD参考掩码对齐整体形状
  • 真实织物数据集实验表明方法优于基线,消融验证多分支设计有效性
学术论文arXiv2026-08-11

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

BooST框架桥接语义与运动,提升机器人技能迁移效率和鲁棒性

  • 提出BooST两阶段框架,通过跨模态VQ-VAE统一语义意图与运动动态
  • 将技能表示蒸馏为轻量策略,实现高效下游任务适应
  • 仿真与真实机器人实验验证少样本适应、跨域迁移及视觉干扰鲁棒性
学术论文arXiv2026-08-11

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

提出RynnValue价值基础模型,用时间距离标注实现零样本泛化

  • RynnValue以时间距离替代偏好或进度标注,可扩展至7000小时、约300万条指令片段
  • 结合随机时间采样、时序打乱和值隔离注意力,提升时间价值学习可靠性
  • 在RBM-EVAL-OOD上Kendall tau达0.675,超越偏好监督SOTA,并提升真实策略成功率
学术论文arXiv2026-08-10

Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition

提出CTDE与混合奖励架构提升机器人操作在线强化学习效率。

  • 提出结合集中训练分散执行(CTDE)与混合奖励架构(HRA)的统一框架,多智能体共享中心化多头评论家。
  • 评论家分解为任务头与抓取头,分别对应稀疏任务奖励和基于势能的抓取奖励。
  • 在双臂和模拟人形机器人上验证,成功率较基线从60%提升至80%以上,并适应更大随机化范围。
学术论文arXiv2026-08-10

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

提出WorldSimProbe框架,诊断具身操作中行动条件世界模型的模拟器保真度。

  • 定义可观察模拟器契约,要求动作引发相应智能体运动且环境响应基于真实运动
  • 提出五个受控测试套件,覆盖控制敏感性、轨迹变化、交互接地和动力学
  • 在RoboTwin、ManiSkill和LIBERO上评估六个开源ACWM,发现系统性保真度缺陷
学术论文arXiv2026-08-07

A Haptic Robot Finger Designed for Guqin Instrument Playing

研发仿生触觉手指用于古琴演奏,验证触觉感知与双手协调

  • 开发模拟人类指尖和指甲形状的仿生多模态触觉指尖
  • 在古琴弦接触任务中验证开弦与按音对比、调音及触觉触发双手协调
  • 将触觉感知与机器人技术结合,助力文化遗产保护与传播
学术论文arXiv2026-08-07

Unordered Landmark Visual Navigation

提出无需时序先验的RGB视觉导航框架ULVN,提升机器人导航鲁棒性。

  • 针对无序图像集下的视觉导航问题,提出统一RGB框架ULVN,消除时序和里程计先验依赖。
  • 通过几何验证和最大生成森林构建二维拓扑地图,结合图信念传播与熵自适应融合实现全局定位与动态子目标规划。
  • 在仿真和真实环境中验证,性能显著优于现有方法,缓解感知混叠与映射失败。
学术论文arXiv2026-08-07

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

提出GeniWorld世界模型,实现机械臂操作零样本泛化与策略评估

  • 基于预训练视频生成模型,将数值动作转为视觉动作表示,实现空间动作控制
  • 解耦具身运动学与环境动力学,缓解场景过拟合,建模机器人与环境交互
  • 仅用有限固定场景数据训练即可零样本泛化,并可作为策略评估器提升下游策略鲁棒性
学术论文arXiv2026-08-07

Robot Learning from Human Demonstrations: Handwritten Alphabet Trajectories and Human-Likeness Evaluation

提出从人类演示学习手写轨迹的机器人框架,人类相似度评分71.5。

  • 收集22名参与者、3142条手写演示数据,覆盖52个拉丁字母大小写组合。
  • 扩展GMM/GMR方法,融合力与归一化时间维度,支持多段非连续轨迹泛化。
  • 用户研究显示生成轨迹人类相似度得分71.50,并开源数据集作为可复现基准。
学术论文arXiv2026-08-06

IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level Mutation

提出IcFuzz,用LLM引导的模糊测试提升Isaac Sim覆盖率并发现多个bug。

  • IcFuzz是首个针对NVIDIA Isaac Sim的模糊测试方法,利用LLM进行语义阶段分割。
  • 设计多级变异算子和多臂老虎机算法自适应调度,有效探索仿真状态空间。
  • 实验显示代码覆盖率达基线190%-205%,发现11个bug,9个已被确认或修复。
学术论文arXiv2026-08-06

KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots

提出人形机器人多模态里程计KILVO,融合关节编码器、IMU、LiDAR和相机。

  • 提出面向人形机器人的KILVO里程计,融合关节编码器、IMU、LiDAR和相机。
  • 采用异步-顺序混合误差状态迭代卡尔曼滤波,先惯性预测、腿运动学约束,再LiDAR几何先验和视觉光度误差更新。
  • 设计多模态自适应机制和紧凑接触估计模块,提升传感器故障鲁棒性,并在多平台真实场景验证。
学术论文arXiv2026-08-05

RORA: Realistic Object Reconstruction with Articulation

提出从单静态视频重建可关节仿真资产,用于机器人灵巧手操作训练。

  • 提出端到端管道RORA,从单一静态物体视频重建带关节的仿真就绪资产。
  • 混合3DGS渲染与网格物理表示,结合用户分组和自动关节建议算法。
  • 在PartNet-Mobility和真实物体上验证,并部署于Isaac Sim和Unreal Engine演示灵巧手操作。
学术论文arXiv2026-08-04

PFM-HR: Pose Flow Matching for Humanoid Robots

提出PFM-HR,用姿态几何分数引导人形机器人运动跟踪强化学习。

  • PFM-HR是在大规模无序姿态数据上训练的可重用流匹配先验。
  • 引入姿态几何分数PGS量化关节变化与先验局部几何的对齐度。
  • 实验表明该方法提升单运动与通用运动跟踪,尤其在高动态运动中。
学术论文arXiv2026-08-04

Toward Certified Functional Safety for Industrial Humanoid Robots: The Fail-Passive Gap and a Feasibility Study

工业人形机器人功能安全认证存在失效被动缺口,研究验证可行性。

  • 腿足机器人安全状态需主动控制,断电会导致跌倒,违反ISO 13849-1/EN 60204-1的失效被动假设。
  • 通过认证外部安全链定位残余不可认证元素在机器人侧反应链,平衡人形机器人无法采用接触器断电方案。
  • 在Unitree G1 EDU抓放单元上验证,提出主动安全状态分析和时序预算,但车载计算非安全级,缺口被强化并定位到SDA与平衡策略接口。