跳到正文

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 1–13 条 · 共 13 条
9月30日周三
  1. Ars Technica · AI77

    AMD将以$8.2 billion收购World Labs

    AMD与World Labs宣布,AMD将在获得监管批准后于年底前收购这家世界模型公司,交易估值为$8.2 billion。World Labs由李飞飞等研究者于2024年创立,其Marble工具可用Gaussian splats生成小型3D空间,并导出用于影视制作和游戏开发的3D资产。文章还提到,生成机器人训练所需的合成数据是该领域的重要应用方向。

    推荐理由:这笔收购将 World Labs 的世界模型与 3D 生成能力纳入 AMD 的 AI 布局,也呈现了机器人合成数据赛道的竞争方向。

9月24日周四
  1. Microsoft Research72

    Microsoft Research:物理 AI 机器人推理卸载可提升性能与续航

    Microsoft Research 的研究显示,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可提升移动操作任务的成功率、模型运行能力和电池续航。

    推荐理由:文章以移动操作机器人工作负载为对象,比较板载、边缘与云端 GPU,呈现推理基础设施对任务成功率、续航和模型部署的具体影响。

9月22日周二
  1. NVIDIA Blog63

    NVIDIA为何强调物理 AI 规模化部署需要全层级安全

    NVIDIA指出,物理 AI 从研究走向大规模部署后,自动驾驶汽车和机器人需要在硬件、软件、AI 行为、运行环境及整个部署生命周期中持续满足安全要求。NVIDIA介绍了覆盖 AV 与机器人的 NVIDIA Halos 全栈安全系统,以及仿真、合成数据、运行时监控和第三方评估等安全基础设施。

    推荐理由:文章把物理 AI 的安全拆解到硬件、软件、AI 行为、运行环境和部署生命周期,并以 NVIDIA Halos 展示 AV 与机器人场景的工程化路径。

8月21日周五
  1. Google DeepMind65

    Google DeepMind 携手 Fenris Creations 推进 EVE 宇宙 AI 游戏研究

    Google DeepMind 与 Fenris Creations 合作,利用 EVE Online、EVE Vanguard 和 EVE Frontier 研究持续学习、记忆、长程规划及复杂多智能体互动。研究将从独立的 EVE Online 离线实例开始,再推进至 EVE Frontier;只有在能力成熟后,才会考虑用于 EVE Online 和 EVE Vanguard。

    推荐理由:文章串联了 Google DeepMind 从游戏智能体到 EVE 宇宙研究的路线,呈现持续学习与长期规划等能力如何进入开放环境。

8月14日周五
  1. Hugging Face Blog69

    用 Strands Agents、LeRobot 与 Hugging Face Storage Buckets 完成机器人数据记录、训练与部署

    Strands Robots 将机器人示范记录、同步、流式训练和策略部署串成一条数据闭环,数据全程保持 LeRobot 格式。教程展示了如何把数据同步到 Hugging Face Storage Bucket,通过 Xet 仅上传变化字节,并从 Hub 流式读取训练而不先完整下载;训练后的 checkpoint 可通过 mode="real" 部署回实体机器人。

    推荐理由:文章把机器人示范采集、数据同步、流式训练和策略部署串成一条可运行链路,展示了 Storage Buckets 如何减少重复传输。

7月30日周四
7月28日周二
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Robotics 2,支持全身控制与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。

    推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。

7月27日周一
  1. Hugging Face Blog77

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一款由动作条件驱动、面向手术机器人的实时生成式模拟器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,针对 dVRK 桌面缝合进行训练,在单张 NVIDIA RTX PRO 6000 上可达约 160 frames per second。

    推荐理由:文章展示了从世界模型蒸馏到实时闭环模拟的技术路径,并给出手术机器人策略训练与评估的具体应用方向。

7月21日周二
  1. Hugging Face Blog77

    Grabette 开放式机器人操作数据采集系统发布

    Hugging Face 发布 Grabette,这是一套低成本、开源的手持式机器人操作数据采集系统,可将人手示范自动处理为机器人可用的数据集。Grabette 配备双摄像头、IMU 和夹爪,BOM 成本约为 490€,数据可通过浏览器处理为 LeRobot 格式并上传 Hugging Face Hub。

    推荐理由:文章清晰展示了如何用低成本手持设备采集操作示范,并通过浏览器处理为可训练的机器人数据集。

7月8日周三
  1. Mistral AI63

    Mistral AI 发布 8B 具身导航模型 Robostral Navigate

    Mistral AI 发布 8B 模型 Robostral Navigate,仅使用单个 RGB 摄像头和自然语言指令控制机器人自主导航。该模型在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。

    推荐理由:文章将单 RGB 摄像头导航的基准表现、训练数据规模与 prefix-caching 方法放在一起,便于理解其技术取舍。

7月7日周二
  1. Hugging Face Blog80

    Hugging Face 发布 LeRobot v0.6.0,完善机器人学习闭环

    Hugging Face 发布 LeRobot v0.6.0,新增世界模型策略、奖励模型、六个仿真基准和 lerobot-rollout 部署 CLI。数据集支持深度、VLM 自动语言标注和自定义视频编码,数据加载最高提速约 2x;训练新增 FSDP 与 HF Jobs 云训练。

    推荐理由:LeRobot v0.6.0 将世界模型策略、奖励模型、统一评测和部署采集串成闭环,并补充数据处理与云训练能力,便于理解机器人学习工作流的变化。

4月13日周一
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,升级空间与物理推理、多视角理解和任务成功检测能力。模型新增仪表读数能力,可通过工具调用、agentic vision 和代码执行解读压力表等设备。

    推荐理由:文章集中展示了 Gemini Robotics-ER 1.6 在多视角成功检测、仪表读数和安全约束上的改进,并说明开发者如何调用该模型。