GPT-5.6 Sol在Roboflow视觉评测中目标检测得分达46.2,较前代GPT-5.5提升超3倍,成为OpenAI迄今最强视觉AI;其在文档版面识别、密集物体计数、空间规则理解等实用任务表现突出,但OCR定向提取能力下降,且大图推理存在框偏问题;成本与速度不及Gemini 3.5 Flash,凸显视觉大模型正从‘能看懂’转向‘干得准’的实用化竞争。
什么?!
GPT-5.6 Sol,竟是隐藏的「视觉大师」。
最近,第三方视觉评测机构Roboflow,把GPT-5.6 「全家桶」拖进自家VLM基准跑了一圈。

测试的内容,都是最实在的活儿:找东西、数东西、认字、抽信息。
仅在目标检测这项,上一代GPT-5.5只拿到13.8分。这个分数,在视觉模型圈里基本等于交白卷。
这次Sol冲到了46.2,三倍还多。
Roboflow项目负责人SkalskiP直言,「GPT-5.6 Sol是OpenAI有史以来最强的视觉模型」!

一直以来,目标检测是GPT系列的重灾区。任务很简单:就是让模型在图上把每个东西框出来。
上一代GPT-5.5的表现,基本等于「知道图里有东西,但框哪儿全靠蒙」。
GPT-5.6 Sol分数,直接飙涨至46.2,三倍多。
更有意思的是,Terra和Luna也紧跟在后面,44.7和43.3。
值得一提的是,Luna是这一代里最便宜的那档,它的检测分照样把上一代旗舰按在地上摩擦。
在计数方面,分数同样在涨。
Sol的准确率从GPT-5.5的64.9%升到73%,Terra和Luna分别是67.6%和66.2%。


那么,GPT-5.6具体强在哪?
文档版面识别最亮眼,标题、正文、表格、插图、签名,Sol都能干净地圈出来。
这件事对做合同、发票、报表处理的人来说不是小事:几乎所有文档流水线的第一步,都是先找到「该看哪一块」,再去认字。

就连密集场景,GPT-5.6也扛住了。
药片、鸡蛋这类几十个同款物体挤在一起的图,是VLM的传统翻车现场。
因为大模型画框,是一个坐标一个坐标地把数字打出来,东西越多,输出越长,漏掉、重复、坐标写飞的概率就越高。


甚至还有更刁的:一张靶纸,只让它数落在指定环数区域里的弹孔。
Sol直接做对了,它不仅知道要数什么,还知道规则管到哪儿为止。
不得不说,这一块的进步是实打实的。


最反常识的一段在这儿:Sol的认字能力,是退步的。
OCR整段转写,Sol拿90.7%,比GPT-5.5的91.2%低了半个点,差别不大。
但「定向提取」这一项,不要全文,只要那一条信息,比如把发票上的日期揪出来,Sol只拿下了82.5%,GPT-5.5 是87.6%,掉了5个点。
它不是不认字。手写笔记它能整段转写,也能准确挑出日期,脏轮胎弧面上印的尺寸编号它读得出来。
还有,冰球比赛直播画面里的实时比分,它能按你指定的格式吐出来。
翻车的是药板上那行有效期:字小、竖排、低对比度、还有反光。




一个能读懂比赛转播画面的模型,却读不出你手里那盒药什么时候过期。


在部分图片上,Sol返回的检测框会飘到画面里毫不相干的地方。
跟真实物体几乎零重叠,而且这些框往往排得异常整齐:一条直线,或者均匀分布的一组。
Roboflow把这些样例发给了OpenAI。对方的回复很干脆:Sol在图片尺寸达到2000×2000像素左右或更大时,会变得不稳定,推理档位调得越低,越不稳定。
解法有两个。一是调高推理档位,稳是稳了,但Token用量、延迟、账单全跟着涨。
二是最土也最有效的那个:在发给API之前,先把图缩小或者裁一刀。

再来看整个账单,Roboflow实测下来的成本和速度:
Sol:约2.5美分/张,约10秒;Terra:约1美分/张,约6秒;Luna:不到0.5美分/张,约5秒
而Gemini 3.5 Flash每张0.8美分,比Sol便宜三分之二,检测和计数在这套基准上还继续领先。
面对高频、大批量的检测计数任务,Gemini Flash仍是「性价比之王」。
所以,GPT-5.6 Sol这次真正让人意外的,是视觉能力正在从「看懂一张图」,跨进「真正干视觉的活」。

找目标、画框、计数、理解空间关系、拆文档版面。
这些过去更像是专用视觉模型的地盘,如今正在被大模型一
视觉大模型的下半场,已经从「能不能看懂」卷向了「干活准不准」。
GPT-5.6亮出了肌肉,但性价比的战争,才刚刚开始。
本文来自微信公众号“新智元”,作者:ASI启示录