核心发布
H Company 于 9月3日(上海时间 21:13)在 Hugging Face 官方博客宣布发布 NeoMME 家族,包括 260M 与 800M 两个多模态多语言基座,以及对应的 NeoMME-Retriever 双头检索版本。官方称模型不使用独立预训练视觉塔或因果语言模型,由单一双向 Transformer 同时处理文本与图像块,已在 Transformers 中提供实现,权重以 Apache 2.0 许可开放。
架构与训练
据官方博客,两档模型共享同一架构:文本采用 13.1 万词表 BPE,切分为 token;图像按 32×32 图像块经小型 MLP 投影后与文本进入同一编码器,保留长宽比与分辨率差异,长上下文 16,384(约可放 2 张 3840×2160 4K 图),多数层为对称滑动窗口注意力、每六层与末层为全局注意力,叠加分组查询注意力、2D RoPE 等编码器改进。
预训练从零开始,采用掩码离散扩散的文本去噪目标:文本样本掩码率 0–1 随机,图文样本 0.3–1 且图像块全程可见,迫使模型借助图像证据还原被掩码文本。数据涵盖多语文本、代码、数学、自然图像与文档图像,合计处理约 5240 亿 packed token(含 2900 亿纯文本)。
检索能力与效率
为验证下游能力,团队以 ColPali 的页面图像方法微调出 NeoMME-Retriever,复用基座并增加 dense(均值池化)与 late-interaction(128 维 token/patch 级)双头,一次前向同时返回两种表示,可单独或级联使用。
在 ViDoRe v3 上,NeoMME-Retriever-260M nDCG@10 达 0.523,为 <800M 参数中最高,距 3.75B 的 ColQwen2.5-v0.2(0.524)仅差 0.002 且参数约 14 倍更小;800M 版达 0.556,接近 0.85B Vultron Flash。官方在 L40S 上以 2048×2048 输入测得 260M 编码约 51 页/秒,约 2 倍于 ColModernVBERT 的 26 页/秒,且在小分辨率输入上亦领先。
针对高分辨图像导致 late-interaction 索引膨胀(平均约 1.5MB/页),官方组合分层 token 池化与非对称量化:池化因子 10+int8 可至 39kB/页(39 倍,保留>99% 质量),因子 8+int8 查询/二值文档可至 6kB/页(255 倍,保留>95%),用户可按预算在质量-存储前沿选点。
限制与可用性
官方说明 NeoMME-260M/800M 为预训练编码器主干,需为检索、分类等任务微调任务头后方可落地;检索版已提供 dense/late 双头检查点,支持 Sentence Transformers v6 与 Transformers 原生调用。模型尚未进行全面的安全、偏见与隐私评估,中文等多语种效果需结合自身文档分布实测。发布物已集中在 Hugging Face Collection,含 260M/800M 基座与检索版权重、Transformers 文档与 Visual RAG 演示空间。
对中国开发者的意义
该发布为视觉文档检索与视觉 RAG 提供了更紧凑高效的多语言基座:无需 OCR 即可保留版式、图表与表格的视觉线索;单次前向双表示与高吞吐利于大规模建库与增量索引,255 倍压缩显著降低向量库成本。已使用 Transformers 的团队可直接评估与微调,非检索场景建议先以小规模中文文档集验证召回与排序增益。