零样本学习

# 零样本学习

Level-Navi Agent-Search

Level Navi Agent Search

Level-Navi Agent是一个开源的通用网络搜索代理框架，能够将复杂问题分解并逐步搜索互联网上的信息，直至回答用户问题。它通过提供Web24数据集，覆盖金融、游戏、体育、电影和事件等五大领域，为评估模型在搜索任务上的表现提供了基准。该框架支持零样本和少样本学习，为大语言模型在中文网络搜索代理领域的应用提供了重要参考。

VideoGrain

VideoGrain 是一种基于扩散模型的视频编辑技术，通过调节时空注意力机制实现多粒度视频编辑。该技术解决了传统方法中语义对齐和特征耦合的问题，能够对视频内容进行精细控制。其主要优点包括零样本编辑能力、高效的文本到区域控制以及特征分离能力。该技术适用于需要对视频进行复杂编辑的场景，如影视后期、广告制作等，能够显著提升编辑效率和质量。

X-Dyna

X-Dyna是一种创新的零样本人类图像动画生成技术，通过将驱动视频中的面部表情和身体动作迁移到单张人类图像上，生成逼真且富有表现力的动态效果。该技术基于扩散模型，通过Dynamics-Adapter模块，将参考外观上下文有效整合到扩散模型的空间注意力中，同时保留运动模块合成流畅复杂动态细节的能力。它不仅能够实现身体姿态控制，还能通过本地控制模块捕捉与身份无关的面部表情，实现精确的表情传递。X-Dyna在多种人类和场景视频的混合数据上进行训练，能够学习物理人体运动和自然场景动态，生成高度逼真和富有表现力的动画。

Meta Motivo

Meta Motivo是由Meta FAIR发布的首款行为基础模型，通过一种新颖的无监督强化学习算法预训练，用于控制复杂的虚拟人形代理完成全身任务。该模型能够在测试时，通过提示解决未见过的任务，如动作跟踪、姿势达到和奖励优化，无需额外学习或微调。这一技术的重要性在于其零样本学习能力，能够处理多种复杂任务，同时保持行为的鲁棒性。Meta Motivo的开发背景是基于对更复杂任务和不同类型代理的泛化能力的追求，其开源的预训练模型和训练代码鼓励社区进一步发展行为基础模型的研究。

Diffusion Self-Distillatio

Diffusion Self Distillatio

Diffusion Self-Distillation是一种基于扩散模型的自蒸馏技术，用于零样本定制图像生成。该技术允许艺术家和用户在没有大量配对数据的情况下，通过预训练的文本到图像的模型生成自己的数据集，进而微调模型以实现文本和图像条件的图像到图像任务。这种方法在保持身份生成任务的性能上超越了现有的零样本方法，并能与每个实例的调优技术相媲美，无需测试时优化。

Voicv

Voicv是一个尖端的语音克隆平台，可在几分钟内将您的语音转换为数字资产，支持多种语言和零样本学习。该平台结合了先进的AI技术和用户友好的设计，提供专业级别的语音克隆能力。Voicv的主要优点包括零样本语音克隆、多语言支持、实时处理、高准确性、跨平台支持和企业级准备。产品背景信息显示，Voicv致力于通过其技术帮助内容创作者、配音演员等用户以多语言制作内容，同时保持个人品牌和声音特征。

SAMURAI

SAMURAI是一种基于Segment Anything Model 2 (SAM 2)的视觉对象跟踪模型，专门设计用于处理快速移动或自遮挡对象的视觉跟踪任务。它通过引入时间运动线索和运动感知记忆选择机制，有效预测对象运动并优化掩膜选择，无需重新训练或微调即可实现鲁棒、准确的跟踪。SAMURAI能够在实时环境中运行，并在多个基准数据集上展现出强大的零样本性能，证明了其无需微调即可泛化的能力。在评估中，SAMURAI在成功率和精确度上相较于现有跟踪器取得了显著提升，例如在LaSOT-ext上AUC提升了7.1%，在GOT-10k上AO提升了3.5%。此外，与LaSOT上的全监督方法相比，SAMURAI也展现出了竞争力，强调了其在复杂跟踪场景中的鲁棒性以及在动态环境中的潜在实际应用价值。

零样本学习

PromptFix

PromptFix是一个综合框架，能够使扩散模型遵循人类指令执行各种图像处理任务。该框架通过构建大规模的指令遵循数据集，提出了高频引导采样方法来控制去噪过程，并设计了辅助提示适配器，利用视觉语言模型增强文本提示，提高模型的任务泛化能力。PromptFix在多种图像处理任务中表现优于先前的方法，并在盲恢复和组合任务中展现出优越的零样本能力。

ROCKET-1

ROCKET-1是一个视觉-语言模型(VLMs)，专门针对开放世界环境中的具身决策制定而设计。该模型通过视觉-时间上下文提示协议，将VLMs与策略模型之间的通信连接起来，利用来自过去和当前观察的对象分割来指导策略-环境交互。ROCKET-1通过这种方式，能够解锁VLMs的视觉-语言推理能力，使其能够解决复杂的创造性任务，尤其是在空间理解方面。ROCKET-1在Minecraft中的实验表明，该方法使代理能够完成以前无法实现的任务，突出了视觉-时间上下文提示在具身决策制定中的有效性。

模型训练与部署

MaskGCT

MaskGCT是一个创新的零样本文本到语音转换（TTS）模型，它通过消除显式对齐信息和音素级持续时间预测的需求，解决了自回归和非自回归系统中存在的问题。MaskGCT采用两阶段模型：第一阶段使用文本预测从语音自监督学习（SSL）模型中提取的语义标记；第二阶段，模型根据这些语义标记预测声学标记。MaskGCT遵循掩码和预测的学习范式，在训练期间学习预测基于给定条件和提示的掩码语义或声学标记。在推理期间，模型以并行方式生成指定长度的标记。实验表明，MaskGCT在质量、相似性和可理解性方面超越了当前最先进的零样本TTS系统。

文本转声音

Whisper large-v3-turbo

Whisper Large V3 Turbo

Whisper large-v3-turbo是OpenAI提出的一种先进的自动语音识别(ASR)和语音翻译模型。它在超过500万小时的标记数据上进行训练，能够在零样本设置中泛化到许多数据集和领域。该模型是Whisper large-v3的微调版本，解码层从32减少到4，以提高速度，但可能会略微降低质量。

Omni-Zero-Couples

Omni Zero Couples

Omni-Zero-Couples是一个使用diffusers管道的零样本风格化情侣肖像创作模型。它利用深度学习技术，无需预先定义的风格样本，即可生成具有特定艺术风格的情侣肖像。这种技术在艺术创作、个性化礼物制作和数字娱乐领域具有广泛的应用前景。

Seed-Music

Seed-Music 是一个音乐生成系统，它通过统一的框架支持生成具有表现力的多语言声乐音乐，允许精确到音符级别的调整，并提供将用户自己的声音融入音乐创作的能力。该系统采用先进的语言模型和扩散模型，为音乐家提供多样化的创作工具，满足不同音乐制作需求。

seed-vc

seed-vc 是一个基于 SEED-TTS 架构的声音转换模型，能够实现零样本的声音转换，即无需特定人的声音样本即可转换声音。该技术在音频质量和音色相似性方面表现出色，具有很高的研究和应用价值。

MimicBrush

MimicBrush是一种创新的图像编辑模型，它允许用户通过指定源图像中的编辑区域和提供一张野外参考图像来实现零样本图像编辑。该模型能够自动捕捉两者之间的语义对应关系，并一次性完成编辑。MimicBrush的开发基于扩散先验，通过自监督学习捕捉不同图像间的语义关系，实验证明其在多种测试案例下的有效性及优越性。

Slicedit

Slicedit是一种零样本视频编辑技术，它利用文本到图像的扩散模型，并结合时空切片来增强视频编辑中的时序一致性。该技术能够保留原始视频的结构和运动，同时符合目标文本描述。通过广泛的实验，证明了Slicedit在编辑真实世界视频方面具有明显优势。

NaturalSpeech 3

Naturalspeech 3

NaturalSpeech 3旨在通过分解语音的不同属性（如内容、韵律、音色和声学细节）并分别生成它们来提高语音合成的质量、相似性和韵律。该系统设计了一个神经编解码器，使用分解的向量量化（FVQ）来解耦语音波形，并提出了一个分解的扩散模型来根据相应的提示生成每个子空间的属性。

OpenVoice

OpenVoice是一个开源的语音克隆技术,可以准确地克隆参考音色,生成多种语言和口音的语音。它可以灵活地控制语音风格,如情感、口音等参数,以及节奏、停顿和语调等。它实现了零样本跨语言语音克隆,即生成语音和参考语音的语言都不需要出现在训练数据中。

Cola

Cola是一种使用语言模型（LM）来聚合2个或更多视觉-语言模型（VLM）输出的方法。我们的模型组装方法被称为Cola（COordinative LAnguage model or visual reasoning）。Cola在LM微调（称为Cola-FT）时效果最好。Cola在零样本或少样本上下文学习（称为Cola-Zero）时也很有效。除了性能提升外，Cola还对VLM的错误更具鲁棒性。我们展示了Cola可以应用于各种VLM（包括大型多模态模型如InstructBLIP）和7个数据集（VQA v2、OK-VQA、A-OKVQA、e-SNLI-VE、VSR、CLEVR、GQA），并且它始终提高了性能。

AI图像检测识别

Computer Vision with DirectAI

Computer Vision With DirectAI

DirectAI是一个基于大型语言模型和零样本学习的平台，可以根据您的描述即时构建适合您需求的模型，无需训练数据。您可以在几秒钟内部署和迭代模型，省去了组装训练数据、标记数据、训练模型和微调模型的时间和费用。DirectAI在纽约市总部，并获得了风投支持，正在改变人们在现实世界中使用人工智能的方式。

模型训练与部署

精选AI产品推荐

NoCode

NoCode 是一款无需编程经验的平台，允许用户通过自然语言描述创意并快速生成应用，旨在降低开发门槛，让更多人能实现他们的创意。该平台提供实时预览和一键部署功能，非常适合非技术背景的用户，帮助他们将想法转化为现实。

ListenHub

ListenHub 是一款轻量级的 AI 播客生成工具，支持中文和英语，基于前沿 AI 技术，能够快速生成用户感兴趣的播客内容。其主要优点包括自然对话和超真实人声效果，使得用户能够随时随地享受高品质的听觉体验。ListenHub 不仅提升了内容生成的速度，还兼容移动端，便于用户在不同场合使用。产品定位为高效的信息获取工具，适合广泛的听众需求。

Lovart

Lovart 是一款革命性的 AI 设计代理，能够将创意提示转化为艺术作品，支持从故事板到品牌视觉的多种设计需求。其重要性在于打破传统设计流程，节省时间并提升创意灵感。Lovart 当前处于测试阶段，用户可加入等候名单，随时体验设计的乐趣。

FastVLM

FastVLM 是一种高效的视觉编码模型，专为视觉语言模型设计。它通过创新的 FastViTHD 混合视觉编码器，减少了高分辨率图像的编码时间和输出的 token 数量，使得模型在速度和精度上表现出色。FastVLM 的主要定位是为开发者提供强大的视觉语言处理能力，适用于各种应用场景，尤其在需要快速响应的移动设备上表现优异。

Smart PDFs

Smart PDFs 是一个在线工具，利用 AI 技术快速分析 PDF 文档，并生成简明扼要的总结。它适合需要快速获取文档要点的用户，如学生、研究人员和商务人士。该工具使用 Llama 3.3 模型，支持多种语言，是提高工作效率的理想选择，完全免费使用。

KeySync

KeySync 是一个针对高分辨率视频的无泄漏唇同步框架。它解决了传统唇同步技术中的时间一致性问题，同时通过巧妙的遮罩策略处理表情泄漏和面部遮挡。KeySync 的优越性体现在其在唇重建和跨同步方面的先进成果，适用于自动配音等实际应用场景。

AnyVoice

AnyVoice是一款领先的AI声音生成器，采用先进的深度学习模型，将文本转换为与人类无法区分的自然语音。其主要优点包括超真实的声音效果、多语言支持、快速生成能力以及语音定制功能。该产品适用于多种场景，如内容创作、教育、商业和娱乐制作等，旨在为用户提供高效、便捷的语音生成解决方案。目前产品提供免费试用，适合不同层次的用户。

LiblibAI

LiblibAI是一个中国领先的AI创作平台,提供强大的AI创作能力,帮助创作者实现创意。平台提供海量免费AI创作模型,用户可以搜索使用模型进行图像、文字、音频等创作。平台还支持用户训练自己的AI模型。平台定位于广大创作者用户,致力于创造条件普惠,服务创意产业,让每个人都享有创作的乐趣。

AIbase

智启未来，您的人工智能解决方案智库

English 简体中文繁體中文にほんご

© 2025AIbase