据动察 Beating 监测,腾讯做了一套 Agent 基准 WorkBuddy Bench,顺手让自家 CodeBuddy Code 和 Claude Code 正面对打。 260 道真实工作题分成代码、Web、办公、安全四类,7 个模型都用两套 Harness 各跑一遍。Harness 就是模型外面的 Agent 执行层,负责上下文、工具调用和任务执行。 28 组同模型对比,Claude Code 赢了 17 组,CodeBuddy 只赢 11 组。代码更是 7:0,7 个模型换成 Claude Code 后全部涨分。 CodeBuddy 也没有全面挨打。Web 和办公都是 4:3 小胜,安全则被 Claude Code 4:3 拿下。 同一个模型只换 Harness,成绩就能差十几分。所以看 Agent 强不强,已经不能只看底层模型。 但腾讯这份榜单也有明显软肋。260 道题拆成四类后,每类只有 50 到 80 题。社区有人直接追问:再加几道难题,排名会不会就变了?GitHub 上也有人嫌只测了两套 Harness,连 Codex 都没有。
查看原文 >