视频理解

# 视频理解

VideoRAG

VideoRAG 是一种创新的检索增强型生成框架，专门用于理解和处理极长上下文视频。它通过结合图驱动的文本知识锚定和层次化多模态上下文编码，实现了对无限制长度视频的理解。该框架能够动态构建知识图谱，保持多视频上下文的语义连贯性，并通过自适应多模态融合机制优化检索效率。VideoRAG 的主要优点包括高效的极长上下文视频处理能力、结构化的视频知识索引以及多模态检索能力，使其能够为复杂查询提供全面的回答。该框架在长视频理解领域具有重要的技术价值和应用前景。

Qwen2.5-VL

Qwen2.5-VL 是 Qwen 团队推出的最新旗舰视觉语言模型，是视觉语言模型领域的重要进步。它不仅能够识别常见物体，还能分析图像中的文字、图表、图标等复杂内容，并支持对长视频的理解和事件定位。该模型在多个基准测试中表现出色，尤其在文档理解和视觉代理任务中具有显著优势，展现了强大的视觉理解和推理能力。其主要优点包括高效的多模态理解、强大的长视频处理能力以及灵活的工具调用能力，适用于多种应用场景。

Tarsier

Tarsier 是由字节跳动研究团队开发的一系列大规模视频语言模型，旨在生成高质量的视频描述，并具备强大的视频理解能力。该模型通过两阶段训练策略（多任务预训练和多粒度指令微调）显著提升了视频描述的精度和细节。其主要优点包括高精度的视频描述能力、对复杂视频内容的理解能力以及在多个视频理解基准测试中取得的 SOTA（State-of-the-Art）结果。Tarsier 的背景基于对现有视频语言模型在描述细节和准确性上的不足进行改进，通过大规模高质量数据训练和创新的训练方法，使其在视频描述领域达到了新的高度。该模型目前未明确定价，主要面向学术研究和商业应用，适合需要高质量视频内容理解和生成的场景。

VideoLLaMA3

VideoLLaMA3是由DAMO-NLP-SG团队开发的前沿多模态基础模型，专注于图像和视频理解。该模型基于Qwen2.5架构，结合了先进的视觉编码器（如SigLip）和强大的语言生成能力，能够处理复杂的视觉和语言任务。其主要优点包括高效的时空建模能力、强大的多模态融合能力以及对大规模数据的优化训练。该模型适用于需要深度视频理解的应用场景，如视频内容分析、视觉问答等，具有广泛的研究和商业应用潜力。

OmAgent.com

OmAgent是一个多模态原生代理框架，用于智能设备等。它采用分治算法高效解决复杂任务，能预处理长视频并以类似人类的精度进行问答，还能基于用户请求和可选天气条件提供个性化服装建议等。目前官网未明确显示价格，但从功能来看，主要面向需要高效任务处理和智能交互的用户群体，如开发者、企业等。

videoprompt.org

Videoprompt.org

videoprompt.org是一个专注于AI视频生成提示的网站，提供了一系列用于生成、编辑或理解视频内容的指令集。它通过精选的高质量提示集合、社区驱动的方法和对实际应用的关注，帮助用户解锁AI模型在视频处理中的全部潜力，提高视频制作工作流程的效率，并实现一致的高质量结果。

Apollo-LMMs

Apollo是一个专注于视频理解的先进大型多模态模型家族。它通过系统性地探索视频-LMMs的设计空间，揭示了驱动性能的关键因素，提供了优化模型性能的实用见解。Apollo通过发现'Scaling Consistency'，使得在较小模型和数据集上的设计决策能够可靠地转移到更大的模型上，大幅降低计算成本。Apollo的主要优点包括高效的设计决策、优化的训练计划和数据混合，以及一个新型的基准测试ApolloBench，用于高效评估。

Qwen2-VL-7B

Qwen2-VL-7B是Qwen-VL模型的最新迭代，代表了近一年的创新成果。该模型在视觉理解基准测试中取得了最先进的性能，包括MathVista、DocVQA、RealWorldQA、MTVQA等。它能够理解超过20分钟的视频，为基于视频的问题回答、对话、内容创作等提供高质量的支持。此外，Qwen2-VL还支持多语言，除了英语和中文，还包括大多数欧洲语言、日语、韩语、阿拉伯语、越南语等。模型架构更新包括Naive Dynamic Resolution和Multimodal Rotary Position Embedding (M-ROPE)，增强了其多模态处理能力。

Qwen2-VL-2B

Qwen2-VL-2B是Qwen-VL模型的最新迭代，代表了近一年的创新成果。该模型在视觉理解基准测试中取得了最先进的性能，包括MathVista、DocVQA、RealWorldQA、MTVQA等。它能够理解超过20分钟的视频，为基于视频的问题回答、对话、内容创作等提供高质量的支持。Qwen2-VL还支持多语言，除了英语和中文，还包括大多数欧洲语言、日语、韩语、阿拉伯语、越南语等。模型架构更新包括Naive Dynamic Resolution和Multimodal Rotary Position Embedding (M-ROPE)，增强了其多模态处理能力。

PPLLaVA

PPLLaVA是一个高效的视频大型语言模型，它结合了细粒度视觉提示对齐、用户指令的卷积风格池化的视觉令牌压缩以及CLIP上下文扩展。该模型在VideoMME、MVBench、VideoChatGPT Bench和VideoQA Bench等数据集上建立了新的最先进结果，仅使用1024个视觉令牌，吞吐量提高了8倍。

LongVU

LongVU是一种创新的长视频语言理解模型，通过时空自适应压缩机制减少视频标记的数量，同时保留长视频中的视觉细节。这一技术的重要性在于它能够处理大量视频帧，且在有限的上下文长度内仅损失少量视觉信息，显著提升了长视频内容理解和分析的能力。LongVU在多种视频理解基准测试中均超越了现有方法，尤其是在理解长达一小时的视频任务上。此外，LongVU还能够有效地扩展到更小的模型尺寸，同时保持最先进的视频理解性能。

模型训练与部署

Aria

Aria是一个多模态原生混合专家模型，具有强大的多模态、语言和编码任务性能。它在视频和文档理解方面表现出色，支持长达64K的多模态输入，能够在10秒内描述一个256帧的视频。Aria模型的参数量为25.3B，能够在单个A100（80GB）GPU上使用bfloat16精度进行加载。Aria的开发背景是满足对多模态数据理解的需求，特别是在视频和文档处理方面。它是一个开源模型，旨在推动多模态人工智能的发展。

LLaVA-Video

LLaVA-Video是一个专注于视频指令调优的大型多模态模型（LMMs），通过创建高质量的合成数据集LLaVA-Video-178K来解决从网络获取大量高质量原始数据的难题。该数据集包括详细的视频描述、开放式问答和多项选择问答等任务，旨在提高视频语言模型的理解和推理能力。LLaVA-Video模型在多个视频基准测试中表现出色，证明了其数据集的有效性。

Video-CCAM

Video-CCAM 是腾讯QQ多媒体研究团队开发的一系列灵活的视频多语言模型（Video-MLLM），致力于提升视频-语言理解能力，特别适用于短视频和长视频的分析。它通过因果交叉注意力掩码（Causal Cross-Attention Masks）来实现这一目标。Video-CCAM 在多个基准测试中表现优异，特别是在 MVBench、VideoVista 和 MLVU 上。模型的源代码已经重写，以简化部署过程。

Goldfish

Goldfish 是一种为理解任意长度视频而设计的方法论。它通过高效的检索机制，首先收集与指令相关的前k个视频片段，然后提供所需的响应。这种设计使得Goldfish能够有效处理任意长的视频序列，适用于电影或电视剧等场景。为了促进检索过程，开发了MiniGPT4-Video，该模型为视频片段生成详细的描述。Goldfish在长视频基准测试中取得了41.78%的准确率，超过了之前的方法14.94%。此外，MiniGPT4-Video在短视频理解中也表现出色，分别在MSVD、MSRVTT、TGIF和TVQA短视频基准测试中超过了现有最佳方法3.23%、2.03%、16.5%和23.59%。这些结果表明，Goldfish模型在长视频和短视频理解方面都有显著改进。

InternLM-XComposer-2.5

Internlm XComposer 2.5

InternLM-XComposer-2.5是一款支持长上下文输入和输出的多功能大型视觉语言模型。它在各种文本图像理解和创作应用中表现出色，实现了与GPT-4V相当的水平，但仅使用了7B的LLM后端。该模型通过24K交错图像文本上下文进行训练，能够无缝扩展到96K长上下文，通过RoPE外推。这种长上下文能力使其在需要广泛输入和输出上下文的任务中表现突出。此外，它还支持超高分辨率理解、细粒度视频理解、多轮多图像对话、网页制作以及撰写高质量图文文章等功能。

ShareGPT4Video

ShareGPT4Video系列旨在通过密集且精确的字幕来促进大型视频-语言模型(LVLMs)的视频理解以及文本到视频模型(T2VMs)的视频生成。该系列包括：1) ShareGPT4Video，40K GPT4V注释的密集视频字幕，通过精心设计的数据过滤和注释策略开发而成。2) ShareCaptioner-Video，一个高效且功能强大的任意视频字幕模型，由其注释的4.8M高质量美学视频。3) ShareGPT4Video-8B，一个简单但卓越的LVLM，其在三个先进的视频基准测试中达到了最佳性能。

VideoLLaMA2-7B

VideoLLaMA2-7B是由DAMO-NLP-SG团队开发的多模态大型语言模型，专注于视频内容的理解和生成。该模型在视觉问答和视频字幕生成方面具有显著的性能，能够处理复杂的视频内容，并生成准确、自然的语言描述。它在空间-时间建模和音频理解方面进行了优化，为视频内容的智能分析和处理提供了强大的支持。

LVBench

LVBench是一个专门设计用于长视频理解的基准测试，旨在推动多模态大型语言模型在理解数小时长视频方面的能力，这对于长期决策制定、深入电影评论和讨论、现场体育解说等实际应用至关重要。

VideoLLaMA 2

VideoLLaMA 2 是一个针对视频理解任务优化的大规模语言模型，它通过先进的空间-时间建模和音频理解能力，提升了对视频内容的解析和理解。该模型在多选视频问答和视频字幕生成等任务上展现了卓越的性能。

VILA

VILA是一个预训练的视觉语言模型（VLM），它通过大规模的交错图像-文本数据进行预训练，从而实现视频理解和多图像理解能力。VILA通过AWQ 4bit量化和TinyChat框架在边缘设备上可部署。主要优点包括：1) 交错图像-文本数据对于提升性能至关重要；2) 在交错图像-文本预训练期间不冻结大型语言模型（LLM）可以促进上下文学习；3) 重新混合文本指令数据对于提升VLM和纯文本性能至关重要；4) 标记压缩可以扩展视频帧数。VILA展示了包括视频推理、上下文学习、视觉思维链和更好的世界知识等引人入胜的能力。

Video Mamba Suite

Video Mamba Suite

Video Mamba Suite 是一个用于视频理解的新型状态空间模型套件，旨在探索和评估Mamba在视频建模中的潜力。该套件包含14个模型/模块，覆盖12个视频理解任务，展示了在视频和视频-语言任务中的高效性能和优越性。

MA-LMM

MA-LMM是一种基于大语言模型的大规模多模态模型,主要针对长期视频理解进行设计。它采用在线处理视频的方式,并使用记忆库存储过去的视频信息,从而可以在不超过语言模型上下文长度限制或GPU内存限制的情况下,参考历史视频内容进行长期分析。MA-LMM可以无缝集成到当前的多模态语言模型中,并在长视频理解、视频问答和视频字幕等任务上取得了领先的性能。

MiniGPT4-Video

MiniGPT4-Video是为视频理解设计的多模态大模型，能处理时态视觉数据和文本数据，配标题、宣传语，适用于视频问答。基于MiniGPT-v2，结合视觉主干EVA-CLIP，训练多阶段阶段，包括大规模视频-文本预训练和视频问题解答微调。在MSVD、MSRVTT、TGIF和TVQA基准上取得显著提升。定价未知。

VideoPrism

VideoPrism是一个通用的视频编码模型,能够在各种视频理解任务上取得领先的性能,包括分类、定位、检索、字幕生成和问答等。其创新点在于预训练的数据集非常大且多样,包含3600万高质量的视频-文本对,以及5.82亿带有嘈杂文本的视频剪辑。预训练采用两阶段策略,先利用对比学习匹配视频和文本,然后预测遮蔽的视频块,充分利用不同的监督信号。一个固定的VideoPrism模型可以直接适配到下游任务,并在30个视频理解基准上刷新状态最优成绩。

精选AI产品推荐

NoCode

NoCode 是一款无需编程经验的平台，允许用户通过自然语言描述创意并快速生成应用，旨在降低开发门槛，让更多人能实现他们的创意。该平台提供实时预览和一键部署功能，非常适合非技术背景的用户，帮助他们将想法转化为现实。

ListenHub

ListenHub 是一款轻量级的 AI 播客生成工具，支持中文和英语，基于前沿 AI 技术，能够快速生成用户感兴趣的播客内容。其主要优点包括自然对话和超真实人声效果，使得用户能够随时随地享受高品质的听觉体验。ListenHub 不仅提升了内容生成的速度，还兼容移动端，便于用户在不同场合使用。产品定位为高效的信息获取工具，适合广泛的听众需求。

Lovart

Lovart 是一款革命性的 AI 设计代理，能够将创意提示转化为艺术作品，支持从故事板到品牌视觉的多种设计需求。其重要性在于打破传统设计流程，节省时间并提升创意灵感。Lovart 当前处于测试阶段，用户可加入等候名单，随时体验设计的乐趣。

FastVLM

FastVLM 是一种高效的视觉编码模型，专为视觉语言模型设计。它通过创新的 FastViTHD 混合视觉编码器，减少了高分辨率图像的编码时间和输出的 token 数量，使得模型在速度和精度上表现出色。FastVLM 的主要定位是为开发者提供强大的视觉语言处理能力，适用于各种应用场景，尤其在需要快速响应的移动设备上表现优异。

Smart PDFs

Smart PDFs 是一个在线工具，利用 AI 技术快速分析 PDF 文档，并生成简明扼要的总结。它适合需要快速获取文档要点的用户，如学生、研究人员和商务人士。该工具使用 Llama 3.3 模型，支持多种语言，是提高工作效率的理想选择，完全免费使用。

KeySync

KeySync 是一个针对高分辨率视频的无泄漏唇同步框架。它解决了传统唇同步技术中的时间一致性问题，同时通过巧妙的遮罩策略处理表情泄漏和面部遮挡。KeySync 的优越性体现在其在唇重建和跨同步方面的先进成果，适用于自动配音等实际应用场景。

AnyVoice

AnyVoice是一款领先的AI声音生成器，采用先进的深度学习模型，将文本转换为与人类无法区分的自然语音。其主要优点包括超真实的声音效果、多语言支持、快速生成能力以及语音定制功能。该产品适用于多种场景，如内容创作、教育、商业和娱乐制作等，旨在为用户提供高效、便捷的语音生成解决方案。目前产品提供免费试用，适合不同层次的用户。

LiblibAI

LiblibAI是一个中国领先的AI创作平台,提供强大的AI创作能力,帮助创作者实现创意。平台提供海量免费AI创作模型,用户可以搜索使用模型进行图像、文字、音频等创作。平台还支持用户训练自己的AI模型。平台定位于广大创作者用户,致力于创造条件普惠,服务创意产业,让每个人都享有创作的乐趣。

AIbase

智启未来，您的人工智能解决方案智库

English 简体中文繁體中文にほんご

© 2025AIbase