据动察 Beating 监测,OpenRouter 推出 Ori Eval,帮开发者判断自己的 AI 应用该用哪个模型。它会扫描代码库,找到调用模型的位置,再用项目里的真实任务跑遍多个候选模型。 开发者可以指定更看重效果、速度还是成本。评测期间,Ori Eval 会锁定测试框架、模型配置和推理强度,最后直接给出排名,避免不同模型因为测试条件不同而无法比较。 它除了判断回答好不好,还会检查 Agent 是否调用了正确工具、避开不该执行的操作。开发者用自然语言描述一个 Bug,它就能生成一条复现问题的测试。修复后接入 GitHub Actions,后续换模型、改 prompt 或改代码,都能自动检查问题是否再次出现。 公开榜单只能比较模型的通用能力,无法直接回答客服、搜索或编程产品该选哪一款。Ori Eval 把逐个手动试模型,变成一套基于真实业务的自动选型流程。
查看原文 >