DCAI
← 返回全部动态
arXiv 人工智能AI 评分 78/10009月24日 12:00

Ovis-Embedding:拓展通用全模态嵌入模型前沿

该研究推出了全模态嵌入模型家族 Ovis-Embedding,实现对文本、图像、视频和音频的原生整合。不同于将各个独立的模态塔简单组合,Ovis-Embedding 采用共享的多模态骨干网络,将不同模态编码至统一的表征空间中。该模型以预训练的 Qwen-omni 为骨干网络,通过低秩初始化的对比训练完成适配,并引入了以数据为中心的全模态训练策略。

推荐理由提出基于统一骨干网络的原生全模态嵌入模型,推动了音视频图文统一表征学习的发展。

原标题:Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings

阅读 arXiv 人工智能 原文 ↗