Helix是什么?一文让你看懂Helix的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

Helix概述简介

Helix 是 Figure 推出的通用视觉-语言-动作(VLA)模型,用于人形机器人的控制。Helix首创性地实现对机器人整个上身(包括手腕、躯干、头部和手指)的高速率(200Hz)连续控制,支持多机器人协作,多个机器人共用同一组神经网络权重完成任务。Helix 基于自然语言指令拿起从未见过的物品,表现出强大的泛化能力。Helix 的训练完全端到端,无需任务特定的微调,在低功耗 GPU 上运行,具备商业部署潜力。

Helix的功能特色

全上身控制:对机器人整个上半身(包括手腕、躯干、头部和手指)进行高速率(200Hz)的连续控制,实现高精度的动作协调。

多机器人协作:支持多个机器人同时运行同一套神经网络权重,实现协作完成任务,例如共同搬运或整理物品。

自然语言理解与执行:机器人基于自然语言指令完成各种任务,例如拿起从未见过的物品、操作抽屉或冰箱等。

强大的泛化能力:处理数千种形状、大小和材质各异的物品。

商业部署能力:完全在低功耗嵌入式 GPU 上运行,适合大规模商业化应用。

Helix的技术原理

系统2(S2):基于 7B 参数的开源视觉语言大模型(VLM),负责场景理解和语言理解。处理频率为 7-9Hz,用于“慢速思考”高级目标,将视觉和语言信息转化为语义表征。将语义信息编码为连续的潜在向量,传递给系统1。

系统1(S1):基于 80M 参数的 Transformer 编码器-解码器架构,用于底层控制。处理频率为 200Hz,快速执行和调整动作。将 S2 传递的潜在向量与视觉特征结合,转化为精确的机器人动作(如手腕姿态、手指控制、头部和躯干方向)。

端到端训练:从原始像素和自然语言指令映射到连续动作输出,使用标准回归损失进行训练。训练过程中引入时间偏移,模拟 S1 和 S2 的推理延迟,确保训练与部署的一致性。

解耦架构:S1 和 S2 分别运行在不同的时间尺度上,S2 负责高级语义规划,S1 负责实时动作执行。既保证系统的泛化能力,又实现了快速响应。

优化推理部署:在机器人上,S1 和 S2 分别运行在独立的 GPU 上,S2 异步更新潜在向量,S1 实时执行动作控制。

Helix项目介绍

项目官网:https://www.figure.ai/news/helix

Helix的技术原理

家庭服务:整理物品、收纳、操作家电等日常家务。

多机器人协作:多个机器人共享一套神经网络,共同完成搬运或组装任务。

物品抓取:基于自然语言指令抓取从未见过的物品,适用于物流和仓储。

工业自动化:用在复杂的人机协作任务,如零部件装配和质量检测。

服务行业:在酒店、餐厅等场所提供引导、递送和清洁服务。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • Radar
    Radar Radar是X.com推出的一款专注于社交媒体趋势分析的高级搜索工具。它允许用户监控关键词、可视化趋势动态并过滤对话,提供实时的帖子计数统计信息。Ra...
  • remodel ai
    remodel ai 改建AI提供了一种简单有效的方法,可以让您的房子更新。立即探索不同的样式,材料和颜色,为您的外部和内部找到完美的改造。...
  • 跃问yuewen
    跃问yuewen 跃问是一个以教育为核心,利用AI技术为用户提供多样化内容的平台。它能够生成各种风格的文案、解答各类问题,帮助用户获取知识、解决问题。该平台具有高效、便...
  • HR Assistant AI
    HR Assistant AI HR Assistant AI是一款AI驱动的内部支持工具,旨在自动化和简化各种人力资源任务。它通过集成API连接到现有系统,如Slack,同步数据和...
  • GoVoice
    GoVoice GoVoice是一款利用先进人工智能技术进行语音转文本和文本生成的工具,适用于个人创作者、小型企业和人手有限的团队。用户可以通过语音录制内容,选择生成...
  • Vocera
    Vocera Vocera是一个由Y Combinator支持的AI语音代理测试与监控平台,它允许用户通过模拟各种场景和使用真实音频来测试和评估AI语音代理的性能。...
  • oxogen ai
    oxogen ai Oxogen.ai是现代金融投资者的最终AI伴侣。通过利用先进的算法和深层互联网潜水,这项智能服务简化了定性和定量研究,发现基本事实并揭示了潜在的投资...
  • SRM
    SRM SRM是一种基于去噪生成模型的空间推理框架,用于处理连续变量集合的推理任务。它通过为每个未观测变量分配独立的噪声水平,逐步推断出这些变量的连续表示。该...