1. 越疆发布全球首款具身全栖人形机器人鹿萌:六边形智能搭子打通家庭-教育-商演全栖场景
8 月 5 日,越疆科技正式推出全球首款"具身全栖"人形机器人越疆鹿萌(DOBOT LUMO),以"具身全栖"理念同时重构空间、角色、能力、周期四个维度——空间全栖可穿梭家庭、商场、校园;角色全栖可切换为生活搭子、运动玩伴、科普伙伴;能力全栖融合视觉、语音与运动,从被动应答升级为主动感知与行动;周期全栖伴随用户成长持续迭代。鹿萌身高近 1.3 米,采用全栈自研的空弈具身大模型,已在具身智能国际权威基准 LIBERO 评测中以平均成功率全球第一登顶。展会现场全程实拍视频显示,鹿萌可在草坪、沙地、鹅卵石等复杂地形长距离流畅行走,出拳收拳带动腰部协调、闪躲踢腿后顺势完成后空翻,并能夜间识别主人入睡后切换轻柔步态、自动关灯。配套具身智能教学与开发平台支持二次开发,已覆盖机器人基础认知、运动控制、VLA 算法、SLAM 导航、视觉感知、人机交互等实验方向。
值得关注的原因:具身智能从"工业能干活"分化出"消费能陪伴"路径的关键样本。全栈自研基座 + 全球第一基础能力 + 完整二次开发平台形成"软硬一体 + 生态开放"组合,与启元机器人"用户可 DIY 角色"的潮玩路径形成差异化分工。当 LIBERO 全球第一 + L4 拟人步态 + 多地形连续作业能力在消费价位段首次汇合,消费级具身机器人的"能力天花板"已被中国厂商抬至工业级水平之上。
2. 恺望数据完成超 1 亿元战略融资:鹿明机器人、松延动力、自变量、智元觅蜂集体"押注"数据基建
8 月 4 日,AI 数据基建公司恺望数据宣布完成超 1 亿元新一轮战略融资,由北京亦庄产业升级基金、华方资本、天际资本联合领投,鹿明机器人、松延动力、自变量机器人、智元旗下觅蜂科技等头部具身智能公司战略跟投,亚盛资本、清智资本、璞跃资本等老股东追加投资。恺望数据是覆盖数据采集、加工、治理闭环的全链路 AI 数据科技公司,业务覆盖第一视角裸手、触觉传感手套、UMI 夹爪、第三视角全景视频等多模态数据品类,已入驻商超、餐饮门店、家庭空间、汽车工业产线等实景环境完成数据服务。单月有效数据产出稳定在 10 万小时左右,打破了行业 1 万小时有效数据的规模化门槛,并与多家头部公司达成批量数据采购合作。在 2026 WAIC 期间,数据稀缺已成为机器人公司共识痛点,恺望数据成为多家具身公司"用股权换数据流"的标志性配置。
值得关注的原因:具身智能从"模型路线之争"切换到"数据资源争夺"。头部机器人公司集体押注单一数据服务商意味着行业已进入"数据资本化"阶段——头部公司将数据供给链纳入战略持股而非纯采购关系,是中国具身智能 2.0 阶段的关键结构性变化。当数据从"项目成本"变为"公司股权",先行卡位数据基建的服务商将获得比单纯卖数据集更深的市场护城河。
3. 具身智能触觉感知迎"觉醒"时刻:今年前 7 个月融资超 70 亿元,至少两家跻身新晋独角兽
证券时报 8 月 5 日报道,今年前 7 个月触觉感知领域新增融资超 70 亿元,至少两家企业跻身新晋独角兽,成为具身智能产业增速最快的细分赛道。工业柔性操作"翻车"——机器人插接零件时反复摩擦入位困难、拿捏塑料瓶时力度失衡致瓶身凹陷——核心症结是机器人和物理世界交互不能只靠视觉。2025 年末至 2026 年初,头部企业的研发资源向触觉倾斜,行业共识逐渐形成:仅靠视觉无法完成复杂作业,机器人需从"看得见"升级为"摸得到、做得好"。千觉机器人创始人、上海交大副教授马道林表示:“去年底到今年初,业内聚焦于让机器人跳出样机演示,到真实场景中干活,这就要求触觉深度参与决策过程。“业内对适用于富接触任务的VTLA(视觉—触觉—语言—动作)模型需求日益高涨。触觉数据具有不可替代性,数据缺口仍是阻碍规模化落地的核心瓶颈。广东省、广州、深圳、东莞、长沙等多地正加速布局触觉产业。
值得关注的原因:具身智能从 VLA 单模态演进至 VTLA 多模态融合的"感知维度升级"已完成认知共识。触觉的不可替代性意味着它不会像 RLHF 那样被通用大模型内部消化,触觉感知企业有独立做大估值的机会。当"看 + 摸 + 做"成为衡量具身智能产品在真实工业场景可用的硬指标,触觉赛道的爆发将成为机器人从"演示型"切换到"作业型"的关键基础设施。
4. NVIDIA Alpamayo 2 Super 34B VLA 开放商用:LingoQA 第一、自动驾驶基础模型进入"前装量产前夜”
8 月 4 日,NVIDIA 在 Hugging Face 上以 OpenMDW-1.1 许可正式开源 Alpamayo 2 Super,这是 Alpamayo 家族迄今最大的340 亿参数视觉-语言-动作(VLA)模型,专为 L4 级 Robotaxi 与自动驾驶长尾事件设计,发布首日即可商用。该模型基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,可同时输出5 类耦合结果——轨迹、因果链推理(CoC)、元动作、推理自标注、2D 视觉定位问答。LingoQA 榜单以 79.2 分位列第一,超出 Gemini 2.5 Pro 15.1 分、超出 GPT-4o 23.2 分。Alpamayo 系列在 Hugging Face 下载量已超 50 万次,是平台上下载量最大的自动驾驶推理开源模型。奔驰 S-Class(搭载 Uber Robotaxi)、比亚迪、吉利、Geely、Isuzu、Nissan、Volvo、JLR、Hyundai、GM、Toyota 等车厂均基于 NVIDIA DRIVE Hyperion 平台采用 Alpamayo 系列构建 L4 车队。
值得关注的原因:自动驾驶已进入"推理型 VLA 主导时代”。L4 Robotaxi + 重量级车厂前装量产 + 推理可审计三件套叠加,意味着传统模块化感知栈(检测+预测+规划)的工程架构正被一体式 VLA 替代。OpenMDW-1.1 许可允许商用和微调并保留模型出处,使中小厂商首次具备在 L4 自动驾驶上使用世界头部开源推理模型的可能。当 50 万下载量与 LingoQA 第一叠加,Alpamayo 2 Super 已具备成为 Robotaxi 时代"LLaMA 时刻"的潜质。
5. Black Forest Labs FLUX 3 Video 统一多模态开放商用:原生音视频 + 动作预测同源架构定义物理 AI 新底座
8 月 4 日,德国 AI 实验室 Black Forest Labs(BFL) 正式开放 API 的 FLUX 3 Video,这是基于其 Self-Flow 架构原生气视频联合训练的多模态前沿模型。单次生成最长 20 秒 1080p 视频并附带同步音频、对话与多语种 lip-sync(覆盖 14 种语言),定价采用"草稿 + 高清"两段式——草稿 0.06 美元/秒、全高清 0.17 美元/秒。FLUX 3 单一模型同时支持图像生成、视频生成、音频生成与动作预测四大模态输出,区别于 Runway/Luma/Kling 的"图像模型 + 视频模型 + 音频模型拼接"路线。FLUX 3 同源架构已经在与 Mimic Robotics 合作的 FLUX-mimic 机器人模型中衍生出动作预测能力(反应时间约 101ms),并在奥迪产线上完成工业柔性作业的真实测试。2025 年 12 月 BFL 完成 3 亿美元 B 轮融资,估值 32.5 亿美元,Salesforce Ventures、AMP、a16z、英伟达参与。
值得关注的原因:物理 AI 的"同源多模态底座"路线被开源阵营首次完整证明。图像 + 视频 + 音频 + 动作预测四模态同源意味着同一组权重即可用于内容创作与机器人控制两条路径,BFL 用 FLUX-mimic 在奥迪产线的实测证明了"视频预训练隐式学会物理世界"路径的可扩展性。当 FLUX 3 视觉与 FLUX-mimic 动作来自同一底座,行业"世界模型 + VLA"的双轨技术架构面临收敛压力——同一组权重既能生成 20 秒电影感视频,又能驱动产线机器人执行作业。