NeoMME:重新定义高效多模态检索,单塔架构开启视觉 RAG 新篇章
紫喵API服务 的 AI API 使用建议
紫喵API服务 面向需要 OpenAI 兼容接口、Claude/Gemini/GPT 多模型切换、包月额度管理和图像模型调用的用户。阅读本文后,可以结合本站的模型清单、独立使用文档和个人面板,把教程内容直接落到实际调用流程中。
什么是 NeoMME?
NeoMME(全称 Neo Multimodal-native and Multilingual Encoder)是由 Hcompany 团队开发的一系列高效多模态原生且多语言的编码器模型。与当前主流的、依赖于预训练视觉塔(如 SigLIP)和因果语言模型(如 Qwen 或 Llama)的多模态模型不同,NeoMME 采用了创新的单塔(Single-tower)双向 Transformer 架构。
该模型家族包含 260M 和 800M 两个参数版本,旨在通过统一的计算路径处理文本标记和原始图像块,从而大幅提升视觉文档检索(Visual Document Retrieval)和视觉检索增强生成(Visual RAG)的效率。

核心技术:单塔双向 Transformer
大多数现有的多模态检索器通过“投影层”将视觉特征映射到语言空间,这增加了参数冗余和计算开销。NeoMME 彻底改变了这一模式:
- 原生多模态输入:文本通过分词器进入,图像被切分为 32×32 的非重叠补丁(Patches)并通过小型 MLP 投影。两者直接进入同一个双向 Transformer 编码器。
- 动态分辨率支持:模型能够根据图像的长宽比动态调整补丁数量,这意味着处理高分辨率文档页面时能保留更多细节。
- 长上下文与先进堆栈:支持高达 16,384 个标记的上下文长度,足以容纳两张 4K 超高清图像。采用了分组查询注意力(GQA)、查询键归一化(QK Norm)和 2D 旋转位置嵌入(2D RoPE)等现代编码器优化技术。

独特的预训练策略
NeoMME 从零开始训练,使用**离散掩码扩散(Masked Discrete-diffusion)**目标。在训练过程中,图像保持可见,而模型需要重建被遮盖的文本。这种策略强迫模型学会通过图像证据来推断缺失的文本内容,从而建立了深层的图文关联。
性能飞跃:小身形,大能量
在权威的视觉文档检索评测集 ViDoRe v3 上,NeoMME 展现出了惊人的“以小博大”能力:
- NeoMME-260M:得分 0.523,在 800M 参数以下的模型中位列第一。其性能与参数量大其 14 倍的 ColQwen2.5 相当。
- NeoMME-800M:得分 0.556,超越了参数量大其 3.6 倍的 ColPali v1.3。

检索性能对比表
| 模型名称 | 参数量 | ViDoRe v3 (nDCG@10) |
|---|---|---|
| ColModernVBERT | 250M | 0.261 |
| NeoMME-260M | 260M | 0.523 |
| ColPali v1.3 | 2.92B | 0.430 |
| NeoMME-800M | 800M | 0.556 |
| ColQwen2.5 | 3.75B | 0.524 |
极致的推理与存储效率
对于大规模工业应用,检索器的编码速度和索引存储成本至关重要。NeoMME 在这两方面均打破了记录。
1. 极速编码吞吐量
在 NVIDIA L40S GPU 上,以 2048×2048 图像输入进行测试,NeoMME-260M 每秒可处理 51 页 文档,速度几乎是 ColModernVBERT(26 页/秒)的两倍。这意味着企业可以更低成本地完成海量文档的向量化处理。

2. 255 倍存储压缩
传统的后期交互(Late-interaction)索引体积巨大(约 1.5 MB/页)。NeoMME 结合了**层级标记池化(Hierarchical Token Pooling)和非对称量化(Asymmetric Quantization)**技术:
- 压缩效果:成功将每页索引从 1.5 MB 压缩至 6 kB。
- 质量保留:在实现 255 倍压缩的同时,依然保留了 95% 以上的原始检索精度。

应用场景:视觉 RAG 的未来
传统文本 RAG 需要通过 OCR 提取文本,往往会丢失表格结构、流程图信息和排版语境。NeoMME 赋能的 视觉 RAG 流程如下:
- 索引:直接将 PDF 页面转换为图像,使用 NeoMME 生成多模态向量存入向量数据库(如 Qdrant 或 Milvus)。
- 检索:根据用户查询,检索出最相关的原始页面图像。
- 生成:将检索到的图像连同问题发送给视觉语言模型(VLM)生成精准答案。
这种方式避开了繁琐的 OCR 预处理,能更精准地理解包含复杂图表的专业文档。
常见问题解答 (FAQ)
Q: NeoMME 与开源的 ColPali 有什么区别?
A: ColPali 基于预训练的 SigLIP 视觉塔和 PaliGemma 语言模型,架构较重且依赖双塔。NeoMME 是原生的单塔结构,从零训练,在同等参数量下效率更高、速度更快。
Q: 如何获取 NeoMME?
A: NeoMME 现已在 Hugging Face 平台开源,支持 transformers 库,并采用 Apache 2.0 协议发布,开发者可以自由用于商业或科研用途。
Q: 它支持多语言吗?
A: 是的,NeoMME 在预训练中使用了包含 131k 分词的跨语言语料库,能够高效处理中文、英文等多语言文档。
总结:NeoMME 的出现证明了通过精简的单塔架构和高效的训练目标,可以在极小的参数规模下实现顶级强度的多模态检索性能,为视觉 RAG 的大规模落地铺平了道路。