VSI-Bench是什么?一文让你看懂VSI-Bench的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

VSI-Bench概述简介

VSI-Bench(Visual-Spatial Intelligence Benchmark)是李飞飞、谢赛宁及他们的研究团队推出的视觉空间智能基准测试集,研究者构建用在评估多模态大型语言大模型(MLLMs)在空间认知和理解方面的能力。VSI-Bench包含超过5000个问题-答案对,覆盖近290个真实室内场景视频,涉及住宅、办公室和工厂等多种环境。VSI-Bench任务分为配置型任务(如物体计数、相对距离等)、测量估计(如物体尺寸、房间大小等)和时空任务(如物体出现顺序),能系统地测试和提高MLLMs在视觉空间智能方面的表现。

VSI-Bench的功能特色

评估视觉空间智能:量化评估多模态大型语言大模型(MLLMs)的视觉空间智能,包括对空间关系的感知、理解和记忆能力。

基准测试:提供标准化的测试集,包含5000多个问答对,用在基准测试和比较不同MLLMs在视觉空间任务上的性能。

任务多样性:包括配置型任务(物体计数、相对距离、相对方向、路线规划)、测量估计(物体尺寸、房间大小、绝对距离)和时空任务(物体出现顺序),全面覆盖视觉空间智能的多个方面。

视频理解:基于视频输入,VSI-Bench测试MLLMs对连续、时间性输入的理解,比静态图像更接近人类观察世界的方式。

数据质量和控制:基于人工审核确保数据质量,消除歧义和错误标注,提高测试结果的可靠性。。

VSI-Bench的技术原理

数据集构建:基于多个公共室内3D场景重建数据集(如ScanNet、ScanNet++和ARKitScenes),数据集提供高保真度的视频扫描和对象级别的3D注释。

问题-答案对生成:基于数据集中的元信息(如对象类别、边界框)和问题模板自动生成问题-答案对,同时对路线规划任务进行人工标注。

质量控制:实施人工审核流程,确保问题清晰无歧义,对错误或模糊的问题进行溯源和修正。

模型评估:在零样本设置下评估多种视频支持的MLLMs,用默认提示进行测试,采用精确匹配和模糊匹配作为主要评价指标。

性能指标:对于多项选择题(MCA)任务使用准确度(ACC),对于数值答案(NA)任务引入新的度量标准——平均相对准确度(MRA)。

认知图生成:提示MLLMs预测视频中对象的中心位置,生成认知图,评估模型的内部空间表示和记忆能力。

VSI-Bench项目介绍

项目官网:vision-x-nyu.github.io/thinking-in-space

GitHub仓库:https://github.com/vision-x-nyu/thinking-in-space

HuggingFace模型库:https://huggingface.co/datasets/nyu-visionx/VSI-Bench

arXiv技术论文:https://arxiv.org/pdf/2412.14171

VSI-Bench能做什么?

机器人导航与交互:在机器人技术领域,评估和训练MLLMs,更好地理解空间布局,提高机器人在未知环境中的导航和避障能力。

增强现实(AR)/虚拟现实(VR):在AR/VR应用中,帮助MLLMs更好地理解用户的物理空间环境,提供更自然的交互体验。

自动驾驶汽车:自动驾驶系统需要精确的空间理解能力处理复杂的交通场景,用在开发和测试支持自动驾驶的视觉空间智能系统。

智能家居系统:智能家居系统需要理解居住空间的布局和物体的位置,VSI-Bench帮助训练MLLMs,使其更好地服务于智能家居控制和自动化。

室内设计和建筑规划:评估MLLMs在空间规划和设计中的应用,帮助系统提供更合理的布局建议。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • UIGEN-T1-Qwen-7b
    UIGEN-T1-Qwen-7b UIGEN-T1-Qwen-7b 是一个专注于 UI 推理生成的大型语言模型。它通过复杂的推理链路方法生成基于 HTML 和 CSS 的 UI 组件,...
  • Needle
    Needle Needle 是一款专注于提升工作效率的知识串联平台。它利用 AI 技术,将企业内部的各类数据进行整合,打破信息孤岛,让用户能够在短时间内找到所需信息...
  • Bossjob
    Bossjob Bossjob是菲律宾、新加坡和印尼的首要职业发展聊天平台。发现理想工作,发布职位,与雇主连接人才。加入我们,开启职业生涯的新篇章。...
  • Melty
    Melty Melty是一款开源的AI代码编辑器,它能够理解用户从终端到GitHub的操作,并与用户协作编写生产就绪的代码。由Charlie和Jackson开发,...
  • Wikiwand
    Wikiwand Wikiwand是一个基于AI技术的维基百科增强平台,它通过智能搜索、时间线、Map、词典、热门问题等功能,为用户提供更快速、更深入的学习和探索体验。...
  • FaceTune.ai
    FaceTune.ai FaceTune.ai是一款结合了面部情绪识别技术和个性化音乐体验的智能应用。它通过实时分析用户的面部表情,生成或推荐符合用户情绪的音乐,提供沉浸式的...
  • AI Job Interview Coach
    AI Job Interview Coach AI面试教练是一个完整的AI面试辅导平台,提供个性化辅导和专家指导,帮助你自信备战面试。通过计划、练习和改进,你将在面试中取得优异成绩。我们的AI教练...
  • Grafi.ai
    Grafi.ai Grafi.ai是世界上首个专为医疗内容创作者打造的AI辅助撰写工具。它提供基于数据库、科学期刊和自己收集或核查的内容的高质量长文内容。Grafi.a...