Aria-UI是什么?一文让你看懂Aria-UI的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

Aria-UI概述简介

Aria-UI是香港大学和Rhymes AI一起推出的为图形用户界面(GUI)定位任务设计的大型多模态模型。基于纯视觉方法,不依赖于HTML或AXTree等辅助输入,用大规模、多样化的数据合成流程,从Common Crawl和公开数据中生成高质量的元素描述和指令样本,适应不同环境下的多样化指令。Aria-UI创新性地整合动态动作历史信息,用文本或文本-图像交错格式增强模型在多步任务场景中的定位能力。在包括离线和在线代理任务的广泛基准测试中,Aria-UI均取得优异的性能,展现出强大的零样本泛化能力和跨平台适用性,成为通用GUI定位任务的有力解决方案。

Aria-UI的功能特色

GUI元素定位:将语言指令准确地映射到GUI中的目标元素,实现元素的精确定位,为后续的交互操作提供基础。

多模态输入处理:处理包括GUI图像、文本指令、动作历史等多种模态的输入信息,充分理解和利用多模态数据中的丰富信息。

多样化指令适应:基于大规模、多样化的数据合成流程生成的多样化指令样本,有效适应不同环境下的各种指令表达方式。

动态上下文理解:整合动态动作历史信息,用文本或文本-图像交错格式,在多步任务场景中理解当前的动态上下文,为准确的元素定位提供重要参考。

高分辨率图像处理:支持高达3920×2940的图像分辨率,将图像分割成小块处理,显著扩展可处理的图像尺寸范围。

Aria-UI的技术原理

纯视觉方法:采用纯视觉方法,直接从GUI图像中提取视觉特征,用视觉信息理解和定位目标元素。

多模态MoE模型:基于Aria多模态MoE(Mixture of Experts)模型构建,具有3.9B激活参数,擅长处理多模态数据。

数据合成与训练:基于两阶段的数据合成流程,从Common Crawl和公开数据中生成高质量的元素描述和多样化指令样本,覆盖Web、桌面和移动三大GUI环境,为模型训练提供大量、多样化的训练数据,增强模型对不同指令和元素的识别能力。

上下文感知数据扩展:用公开的代理轨迹数据模拟具有上下文的定位任务,构建文本动作历史和文本-图像交错历史两种上下文设置,基于数据合成流程为轨迹数据中的所有定位步骤生成详细的逐步指令,让模型在动态环境中更好地理解和执行任务。

超分辨率支持:将图像分割成小块并进行处理,支持高达3920×2940的图像分辨率,保持图像的细节和准确性。

Aria-UI项目介绍

项目官网:https://ariaui.github.io/

GitHub仓库:https://github.com/AriaUI/Aria-UI

HuggingFace模型库:https://huggingface.co/Aria-UI

arXiv技术论文:https://arxiv.org/pdf/2412.16256

Aria-UI能做什么?

自动化测试:Web应用测试自动点击网页按钮、输入信息,验证功能是否正常。

用户交互辅助:语音指令控制家居设备,如“开灯”自动点击开关按钮。

智能客服:电商平台客服快速定位产品详情,回答用户咨询问题。

教育行业:自动操作代码编辑器,演示编程过程和结果。

自动化办公:自动操作财务软件,生成报表,提高工作效率。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • IllusionDiffusion
    IllusionDiffusion IllusionDiffusion是一款虚拟现实社交平台,用户可以在其中创建自己的虚拟形象,与其他用户进行社交互动。IllusionDiffusion...
  • ChatFly AI
    ChatFly AI ChatFly AI 是一个定制化聊天机器人平台,可帮助企业提升业务效率。它能够与超过 170 种常用工具无缝集成,实现自动化的客户支持、知识管理和教...
  • Boomy
    Boomy Boomy 是一个能够帮助用户在几秒钟内创作原创歌曲的 AI 音乐创作工具。它可以生成各种风格的音乐,即使用户没有音乐创作经验也能轻松使用。用户可以将...
  • clipfly
    clipfly 介绍Clipfly- AI驱动的视频编辑器,可提升您的内容。轻松创建无需高级技能的专业质量视频。借助Clipfly的AI技术,可以增强您的视频,以吸引...
  • Gotalk.ai
    Gotalk.ai Gotalk.ai 是一个强大的 AI 语音生成器,能够在几分钟内创建逼真的语音。完美适用于 YouTube、播客和电话系统问候语。通过先进的 AI ...
  • Data Commons
    Data Commons Data Commons 是一个强大的公共数据平台,旨在通过整合全球公共数据,提供统一的知识图谱,帮助用户轻松探索和分析数据。它由 Google 发起...
  • force.com
    force.com Salesforce Einstein 1平台将数据、人工智能、客户关系管理、开发和安全性统一到一个综合平台中。它提供了丰富的功能和优势,帮助企业构建...
  • AIssistify
    AIssistify AIssistify是一款AI助手,最大限度地提高销售、营销和RevOps的效率。它帮助自动化销售、营销和其他运营流程,简化工作流程。...