Tarsier

1年前发布 43 00

收录时间：

2025-04-08

打开网站手机查看

AI大模型 # AI大模型 # Tarsier # 分类导航 # 大规模视频语言模型 # 视频问答模型

Tarsier

打开网站

Tarsier是由字节跳动研发的大规模视频语言模型家族，旨在生成高质量的视频描述，并具备良好的视频理解能力。Tarsier 采用了简单的模型结构，结合了 CLIP-ViT 编码帧和 LLM 模型来建模时间关系。通过精心设计的两阶段训练策略，Tarsier 展现出了强大的视频描述能力和视频理解能力，在多个公共基准测试中取得了最先进的成果。 Tarsier 模型适用于各种视频理解任务，如视频字幕生成、视频问答和视频定位等，能够处理复杂的视频内容并生成详细准确的描述。 Tarsier：字节跳动推出的大规模视频语言模型家族 Tarsier的主要功能特色高质量视频描述：Tarsier 能够生成详细、准确的视频描述，通过多任务预训练和多粒度指令微调，显著提升了视频描述的能力。视频理解能力：Tarsier 在多个公开基准测试中取得了新的最佳结果，包括视频问答、视频地面、幻觉测试等任务。简单的模型结构：Tarsier 使用 CLIP-ViT 作为视觉编码器，LLM 作为文本解码器，通过 MLP 层连接两者，实现了独立编码帧并输入 LLM 的方法。两阶段训练策略：Tarsier 采用多任务预训练和多粒度指令微调的策略，提高了模型的泛化能力和视频描述的质量。新的视频描述基准：Tarsier 提出了 DREAM-1K 基准，包含 1000 个具有多样复杂性的视频片段，用于评估视频描述模型的质量。 Tarsier模型的最新版本Tarsier2在多个方面进行了显著的改进，特别是在数据量和多样性方面。预训练数据从1100万扩展到4000万视频文本对，增强了模型的学习能力。此外，Tarsier2在监督微调阶段引入了细粒度时间对齐，进一步提高了视频描述的准确性和细节捕捉能力。通过直接偏好优化（DPO）训练，Tarsier2能够生成更符合人类偏好的视频描述，减少生成幻觉的可能性。在性能评估方面，Tarsier2在DREAM-1K基准测试中表现出色，其F1分数比GPT-4o高出2.8%，比Gemini-1.5-Pro高出5.8%。在15个公共基准测试中，Tarsier2取得了新的最佳结果，涵盖视频问答、视频定位、幻觉测试和问答等功能，展示了其作为强大通用视觉语言模型的多功能性。论文：https://arxiv.org/abs/2501.07888 Code: https://github.com/bytedance/tarsier Dataset: https://huggingface.co/datasets/omni-research/DREAM-1K Demo: https://huggingface.co/spaces/omni-research/Tarsier2-7b

数据统计

Tarsier

阿里云百炼

阿里云百炼是基于通义大模型、行业大模型以及三方大模型的一站式大模型开发平台。面向企业客户和个人开发者，提供完整的模型服务工具和全链路应用开发套件，预置丰富的能力插件，提供API及SDK等便捷的集成方式，高效完成大模型应用构建。

暂无评论

您必须登录才能参与评论！

立即登录

暂无评论...

Tarsier

数据统计

相关导航

星流图像大模型

Hibiki

甲骨文AI协同平台-殷契文渊

百度智能云千帆

商量拟人大模型

CodeGemma

Tarsier

阿里云百炼

暂无评论

网址

水果派TV解说视频

bt磁力天堂

龙腾网

书签地球

YepAI搜索引擎

图鸭

热门推荐