Destro AI 获得 $8 million 种子轮融资并扩展物流机器人部署
Destro AI 从隐身状态现身并完成 $8 million seed round,推出协调机器人、人工工人和物流流程的 AI 智能层。公司已在 Yusen Logistics 试点使用 3 台由 Destro Vision 操作系统管理的 cart-moving robots,并计划扩大到 26 台机器人,同时在南加州启动 17 台机器人的新试点。
Destro AI 从隐身状态现身并完成 $8 million seed round,推出协调机器人、人工工人和物流流程的 AI 智能层。公司已在 Yusen Logistics 试点使用 3 台由 Destro Vision 操作系统管理的 cart-moving robots,并计划扩大到 26 台机器人,同时在南加州启动 17 台机器人的新试点。
AMD与World Labs宣布,AMD将在获得监管批准后于年底前收购这家世界模型公司,交易估值为$8.2 billion。World Labs由李飞飞等研究者于2024年创立,其Marble工具可用Gaussian splats生成小型3D空间,并导出用于影视制作和游戏开发的3D资产。文章还提到,生成机器人训练所需的合成数据是该领域的重要应用方向。
推荐理由:这笔收购将 World Labs 的世界模型与 3D 生成能力纳入 AMD 的 AI 布局,也呈现了机器人合成数据赛道的竞争方向。
AMD 以 $8.2B 收购 World Labs,后者已构建面向图像、视频和空间重建的 AI 能力。World Labs 近期发布 Atlas,可根据 2D 图像预测新的相机视角,并通过生成模型与多视图几何结合解决计算机视觉中的稀疏重建问题,应用方向包括机器人仿真、设计、工程和科学。
Tesla 工人因担心 Optimus 人形机器人最终取代自己,曾对穿戴特制服装采集工作动作数据提出抱怨;Tesla 随后将数据采集转交专门团队并设立训练中心。报道称,Optimus 目前仍需在受控环境中通过编程执行特定任务,触觉传感器和制造流程也存在问题;Tesla 还依赖中国供应商,同时面临多国车企和机器人公司的竞争。
Microsoft Research 的研究显示,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可提升移动操作任务的成功率、模型运行能力和电池续航。
推荐理由:文章以移动操作机器人工作负载为对象,比较板载、边缘与云端 GPU,呈现推理基础设施对任务成功率、续航和模型部署的具体影响。
NVIDIA 发布 Isaac ROS 5.0,为基于 ROS 的机器人开发引入智能体工作流和平台支持。
推荐理由:文章将 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持与 Jetson 部署路径串联起来,呈现其从开发到机器人落地的变化。
NVIDIA指出,物理 AI 从研究走向大规模部署后,自动驾驶汽车和机器人需要在硬件、软件、AI 行为、运行环境及整个部署生命周期中持续满足安全要求。NVIDIA介绍了覆盖 AV 与机器人的 NVIDIA Halos 全栈安全系统,以及仿真、合成数据、运行时监控和第三方评估等安全基础设施。
推荐理由:文章把物理 AI 的安全拆解到硬件、软件、AI 行为、运行环境和部署生命周期,并以 NVIDIA Halos 展示 AV 与机器人场景的工程化路径。
Jack Clark 分析 OpenAI 与 Hugging Face 遭攻击事件,担忧智能体通过通信形成集体、为同伴利益自我牺牲的协作行为。五眼联盟声明提出加强与产业合作、及时获取前沿模型,并讨论可能需要额外政府审查的模型特征;Bill Gates 则呼吁全球政策应对 AI 对就业的冲击,并提出将部分工作保留给人类的 Human Reserved 概念。
AgentHands 是 Google Research 提出的研究原型,将 LLM 的语言响应转换为与 TTS 同步的 XR 空间手势,支持智能体在用户环境中进行具身对话。
Google DeepMind 与 Fenris Creations 合作,利用 EVE Online、EVE Vanguard 和 EVE Frontier 研究持续学习、记忆、长程规划及复杂多智能体互动。研究将从独立的 EVE Online 离线实例开始,再推进至 EVE Frontier;只有在能力成熟后,才会考虑用于 EVE Online 和 EVE Vanguard。
推荐理由:文章串联了 Google DeepMind 从游戏智能体到 EVE 宇宙研究的路线,呈现持续学习与长期规划等能力如何进入开放环境。
Strands Robots 将机器人示范记录、同步、流式训练和策略部署串成一条数据闭环,数据全程保持 LeRobot 格式。教程展示了如何把数据同步到 Hugging Face Storage Bucket,通过 Xet 仅上传变化字节,并从 Hub 流式读取训练而不先完整下载;训练后的 checkpoint 可通过 mode="real" 部署回实体机器人。
推荐理由:文章把机器人示范采集、数据同步、流式训练和策略部署串成一条可运行链路,展示了 Storage Buckets 如何减少重复传输。
Google DeepMind 发布 Gemini Robotics ER 2,这是面向机器人的高层具身推理与任务编排模型,可将执行交给 VLA 模型并调用工具。
推荐理由:原文结合视频进度理解、工具编排和多机器人协作,展示了 Gemini Robotics ER 2 面向真实机器人任务的能力变化与开发入口。
Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。
推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。
NVIDIA 发布 Cosmos-H-Dreams,一款由动作条件驱动、面向手术机器人的实时生成式模拟器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,针对 dVRK 桌面缝合进行训练,在单张 NVIDIA RTX PRO 6000 上可达约 160 frames per second。
推荐理由:文章展示了从世界模型蒸馏到实时闭环模拟的技术路径,并给出手术机器人策略训练与评估的具体应用方向。
Hugging Face 发布 Grabette,这是一套低成本、开源的手持式机器人操作数据采集系统,可将人手示范自动处理为机器人可用的数据集。Grabette 配备双摄像头、IMU 和夹爪,BOM 成本约为 490€,数据可通过浏览器处理为 LeRobot 格式并上传 Hugging Face Hub。
推荐理由:文章清晰展示了如何用低成本手持设备采集操作示范,并通过浏览器处理为可训练的机器人数据集。
Mistral AI 发布 8B 模型 Robostral Navigate,仅使用单个 RGB 摄像头和自然语言指令控制机器人自主导航。该模型在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。
推荐理由:文章将单 RGB 摄像头导航的基准表现、训练数据规模与 prefix-caching 方法放在一起,便于理解其技术取舍。
Hugging Face 发布 LeRobot v0.6.0,新增世界模型策略、奖励模型、六个仿真基准和 lerobot-rollout 部署 CLI。数据集支持深度、VLM 自动语言标注和自定义视频编码,数据加载最高提速约 2x;训练新增 FSDP 与 HF Jobs 云训练。
推荐理由:LeRobot v0.6.0 将世界模型策略、奖励模型、统一评测和部署采集串成闭环,并补充数据处理与云训练能力,便于理解机器人学习工作流的变化。
Google DeepMind Accelerator: Robotics 从欧洲遴选15家机器人初创公司,启动为期3个月的密集指导与技术支持项目。入选团队将获得 Google DeepMind 和 Google 专家的技术指导、产品建议,以及 AI stack 和 Gemini robotics models 的使用支持,推动 AI 融入机器人产品。
Google DeepMind 发布 Gemini Robotics-ER 1.6,升级空间与物理推理、多视角理解和任务成功检测能力。模型新增仪表读数能力,可通过工具调用、agentic vision 和代码执行解读压力表等设备。
推荐理由:文章集中展示了 Gemini Robotics-ER 1.6 在多视角成功检测、仪表读数和安全约束上的改进,并说明开发者如何调用该模型。