NeoMME:重新定义高效多模态检索,单塔架构开启视觉 RAG 新篇章

NeoMME:重新定义高效多模态检索,单塔架构开启视觉 RAG 新篇章

AIRouter 2 分钟阅读 1 次浏览

紫喵API服务 的 AI API 使用建议

紫喵API服务 面向需要 OpenAI 兼容接口、Claude/Gemini/GPT 多模型切换、包月额度管理和图像模型调用的用户。阅读本文后,可以结合本站的模型清单、独立使用文档和个人面板,把教程内容直接落到实际调用流程中。

什么是 NeoMME?

NeoMME(全称 Neo Multimodal-native and Multilingual Encoder)是由 Hcompany 团队开发的一系列高效多模态原生且多语言的编码器模型。与当前主流的、依赖于预训练视觉塔(如 SigLIP)和因果语言模型(如 Qwen 或 Llama)的多模态模型不同,NeoMME 采用了创新的单塔(Single-tower)双向 Transformer 架构

该模型家族包含 260M800M 两个参数版本,旨在通过统一的计算路径处理文本标记和原始图像块,从而大幅提升视觉文档检索(Visual Document Retrieval)和视觉检索增强生成(Visual RAG)的效率。

NeoMME 架构图


核心技术:单塔双向 Transformer

大多数现有的多模态检索器通过“投影层”将视觉特征映射到语言空间,这增加了参数冗余和计算开销。NeoMME 彻底改变了这一模式:

  1. 原生多模态输入:文本通过分词器进入,图像被切分为 32×32 的非重叠补丁(Patches)并通过小型 MLP 投影。两者直接进入同一个双向 Transformer 编码器。
  2. 动态分辨率支持:模型能够根据图像的长宽比动态调整补丁数量,这意味着处理高分辨率文档页面时能保留更多细节。
  3. 长上下文与先进堆栈:支持高达 16,384 个标记的上下文长度,足以容纳两张 4K 超高清图像。采用了分组查询注意力(GQA)、查询键归一化(QK Norm)和 2D 旋转位置嵌入(2D RoPE)等现代编码器优化技术。

编码器堆栈细节

独特的预训练策略

NeoMME 从零开始训练,使用**离散掩码扩散(Masked Discrete-diffusion)**目标。在训练过程中,图像保持可见,而模型需要重建被遮盖的文本。这种策略强迫模型学会通过图像证据来推断缺失的文本内容,从而建立了深层的图文关联。


性能飞跃:小身形,大能量

在权威的视觉文档检索评测集 ViDoRe v3 上,NeoMME 展现出了惊人的“以小博大”能力:

  • NeoMME-260M:得分 0.523,在 800M 参数以下的模型中位列第一。其性能与参数量大其 14 倍的 ColQwen2.5 相当。
  • NeoMME-800M:得分 0.556,超越了参数量大其 3.6 倍的 ColPali v1.3。

性能与参数量对比图

检索性能对比表

模型名称 参数量 ViDoRe v3 (nDCG@10)
ColModernVBERT 250M 0.261
NeoMME-260M 260M 0.523
ColPali v1.3 2.92B 0.430
NeoMME-800M 800M 0.556
ColQwen2.5 3.75B 0.524

极致的推理与存储效率

对于大规模工业应用,检索器的编码速度和索引存储成本至关重要。NeoMME 在这两方面均打破了记录。

1. 极速编码吞吐量

在 NVIDIA L40S GPU 上,以 2048×2048 图像输入进行测试,NeoMME-260M 每秒可处理 51 页 文档,速度几乎是 ColModernVBERT(26 页/秒)的两倍。这意味着企业可以更低成本地完成海量文档的向量化处理。

吞吐量对比

2. 255 倍存储压缩

传统的后期交互(Late-interaction)索引体积巨大(约 1.5 MB/页)。NeoMME 结合了**层级标记池化(Hierarchical Token Pooling)非对称量化(Asymmetric Quantization)**技术:

  • 压缩效果:成功将每页索引从 1.5 MB 压缩至 6 kB
  • 质量保留:在实现 255 倍压缩的同时,依然保留了 95% 以上的原始检索精度。

压缩前沿曲线


应用场景:视觉 RAG 的未来

传统文本 RAG 需要通过 OCR 提取文本,往往会丢失表格结构、流程图信息和排版语境。NeoMME 赋能的 视觉 RAG 流程如下:

  1. 索引:直接将 PDF 页面转换为图像,使用 NeoMME 生成多模态向量存入向量数据库(如 Qdrant 或 Milvus)。
  2. 检索:根据用户查询,检索出最相关的原始页面图像。
  3. 生成:将检索到的图像连同问题发送给视觉语言模型(VLM)生成精准答案。

这种方式避开了繁琐的 OCR 预处理,能更精准地理解包含复杂图表的专业文档。


常见问题解答 (FAQ)

Q: NeoMME 与开源的 ColPali 有什么区别?
A: ColPali 基于预训练的 SigLIP 视觉塔和 PaliGemma 语言模型,架构较重且依赖双塔。NeoMME 是原生的单塔结构,从零训练,在同等参数量下效率更高、速度更快。

Q: 如何获取 NeoMME?
A: NeoMME 现已在 Hugging Face 平台开源,支持 transformers 库,并采用 Apache 2.0 协议发布,开发者可以自由用于商业或科研用途。

Q: 它支持多语言吗?
A: 是的,NeoMME 在预训练中使用了包含 131k 分词的跨语言语料库,能够高效处理中文、英文等多语言文档。

总结:NeoMME 的出现证明了通过精简的单塔架构和高效的训练目标,可以在极小的参数规模下实现顶级强度的多模态检索性能,为视觉 RAG 的大规模落地铺平了道路。