Tarsier2是什么?一文让你看懂Tarsier2的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

Tarsier2概述简介

Tarsier2是字节跳动推出的先进的大规模视觉语言大模型(LVLM),生成详细且准确的视频描述,在多种视频理解任务中表现出色。模型通过三个关键升级实现性能提升,将预训练数据从1100万扩展到4000万视频文本对,丰富了数据量和多样性;在监督微调阶段执行精细的时间对齐;基于模型采样自动构建偏好数据,应用直接偏好优化(DPO)训练。 在DREAM-1K基准测试中,Tarsier2-7B的F1分数比GPT-4o高出2.8%,比Gemini-1.5-Pro高出5.8%。在15个公共基准测试中取得了新的最佳结果,涵盖视频问答、视频定位、幻觉测试和具身问答等任务。

Tarsier2的功能特色

详细视频描述:Tarsier2能生成高质量的视频描述,覆盖视频中的各种细节,包括动作、场景和情节。

视频问答:能回答关于视频的具体问题,展现出强大的时空理解和推理能力。

视频定位:Tarsier2可以检测并定位视频中特定事件的发生时间,支持多视频段的定位。

幻觉测试:通过优化训练策略,Tarsier2显著减少了模型生成虚假信息的可能性。

多语言支持:支持多种语言的视频描述生成,进一步拓展了其应用场景。

Tarsier2的技术原理

大规模预训练数据:Tarsier2将预训练数据从1100万扩展到4000万视频-文本对,提升了数据的规模和多样性。数据包括来自互联网的短视频、电影或电视剧的解说视频,通过多模态LLM自动生成的视频描述和问答对。

细粒度时间对齐的监督微调(SFT):在监督微调阶段,Tarsier2引入了15万条细粒度标注的视频描述数据,每条描述都对应具体的时间戳。时间对齐的训练方式显著提高了模型在视频描述任务中的准确性和细节捕捉能力,同时减少了生成幻觉。

直接偏好优化(DPO):Tarsier2通过模型采样自动构建偏好数据,应用直接偏好优化(DPO)进行训练。基于模型生成的正负样本对,进一步优化模型的生成质量,确保生成的视频描述更符合人类的偏好。

Tarsier2项目介绍

GitHub仓库:https://github.com/bytedance/tarsier

arXiv技术论文:https://arxiv.org/pdf/2501.07888

Tarsier2能做什么?

视频描述:Tarsier2 能生成高质量的详细视频描述,涵盖视频中的各种细节,包括动作、场景和情节。

幻觉测试:Tarsier2 在减少生成幻觉方面表现出色。通过直接偏好优化(DPO)和细粒度时间对齐的训练,Tarsier2 显著降低了生成虚假信息的可能性。

多语言支持:Tarsier2 支持多语言的视频描述生成,能满足不同语言环境下的需求。

具身问答:Tarsier2 在具身问答(Embodied QA)任务中也表现出色,能结合视觉和语言信息,为具身智能体提供准确的指导。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • Alice 3.0
    Alice 3.0 Alice 是一款个人 AI 助手应用程序,旨在通过不同的 AI 模型提高用户的工作效率。它集成了最新的 AI 技术,支持自动化工作流,使用户可以更轻...
  • eSearch
    eSearch eSearch 是一款基于Electron开发的跨平台屏幕搜索和截屏软件,支持Linux、Windows和Mac系统。它集成了截屏、OCR文字识别、搜...
  • Tab
    Tab Tab是一款可佩戴的人工智能设备,集成语音助手、实时翻译、日程管理等功能,可成为用户的智能伴侣。它采用轻薄便携的设计,佩戴舒适。通过语音交互,可帮助用...
  • AGI-Samantha
    AGI-Samantha AGI-Samantha是一个模拟电影《她》中Samantha的自主智能体。它具备动态语音能力,能根据上下文自主发言,与一般LLMs相比,不仅仅局限于...
  • Wander
    Wander Wander是一个连接旅行者的平台,帮助他们在旅途中找到志同道合的人。用户可以创建自己的旅行计划,也可以加入其他人的旅行。通过Wander,用户可以轻...
  • rightblogger
    rightblogger RightBlogger是一个由AI驱动的平台,旨在帮助博客作者加速其工作流并简化内容创建过程。借助访问40多个内容创建工具,RightBlogger...
  • MiGPT
    MiGPT MiGPT是一个通过将小爱音箱与ChatGPT的智能理解能力相结合,实现智能家居语音控制的项目。它不仅支持设备自动化,还能够通过角色扮演、流式响应、长...
  • MedGPT
    MedGPT MedGPT是一个专为医务工作者设计的医疗AI写作和诊断平台,集成了各类医疗文档写作、医学影像诊断等AI模型,可以高效生成各类医疗文档、处方报告等,节...