据动察 Beating 监测,Cohere 开源了目前自家最小的视觉语言模型 North Micro Vision,只有 2.4B 参数,采用 Apache 2.0 许可。它主攻文档、表格、图表、截图和 OCR,可以直接处理原始比例和分辨率的图片,不必先压成固定尺寸。 模型由 2B 语言模型和 400M 视觉编码器组成。官方测试中,DocVQA 得分达到 92.1%,超过 Ministral 3 3B 的 89.6% 和 Gemma 4 E2B 的 73.2%,距离 Qwen3.5-2B 的 92.6% 也很近。视觉定位 RefCOCO 得分 73.2%,同样明显高于 Ministral 和 Gemma。 不过它并非同尺寸最强模型。Qwen3.5-2B 在多数通用视觉、OCR 和多模态基准上仍更强,North Micro Vision 的优势更集中在文档理解和视觉定位。它也不是推理模型,不支持工具调用,数学和代码能力有限。
查看原文 >