GitHub 推出一个研究预览版“复合模型”:HydraFusion TerminalBench 评测质量超过 Opus 5 且成本只有 1/3 🤩 开发者在 Copilot 里把它当作一个普通模...
meng shao(@shao__meng) · 人工智能
GitHub 推出一个研究预览版“复合模型”:HydraFusion TerminalBench 评测质量超过 Opus 5 且成本只有 1/3 🤩 开发者在 Copilot 里把它当作一个普通模型选择,但它在运行时会为每个任务动态构建一条跨供应商、多模型的执行流程,目标是以显著更低的成本达到前沿模型水平的代码质量。核心理念是:从"选最好的模型"转向"为每个任务动态构造最好的解法"。 github.blog/ai-and-ml/gith… S 核心机制:三种执行模式 HydraFusion 把"怎么解这个任务"当作一个优化问题,依据推理、代码生成、调试、工具使用等能力信号,为每个请求选择三种模式之一: 1. Single:一个模型直接解题 2. Cascade:高效(便宜)模型先起草,经过一道质量门判断是否接受,不合格则升级到更强模型 3. Critique:模型 A 起草 → 来自另一模型家族的独立、只读批评者审阅(沿用 Rubber Duck 的审查模式)→ A 修订一次 关键词是选择性:系统总是选择"预期能达到质量要求的最简单流程",只有当额外调用大概率能提升结果时才增加模型调用。 五条工程原则 1. 完整核算:把起草、批评、修订、升级、重试、回退每一段的成本和用量全部汇总——不藏成本。 2. 有界执行:每一段都有明确的超时和取消机制,防止成本和时间失控。 3. 隔离审查:批评者运行在无工具、隔离的上下文中,不能改仓库;求解者才使用共享工作区和正常的权限感知 agent 循环。 4. 故障安全应用:流程被取消或验证失败时不应用任何补丁,避免半成品进入仓库。 5. 验证路由:执行前校验工作流定义、模型绑定、回退行为和模型可用性。 评测结果 在三个 agentic 编码基准上,以 Claude Opus 5 和 GPT-5.6 Sol 为基线(所有模型都设为 medium 推理强度,任务输入、工具、限制、定价假设、评分条件完全一致),指标为验证任务质量(确认正确的任务比例)和完整工作流成本: TerminalBench 2.1:成本低 67%,质量 +4.9% DeepSWE:成本低 36%,质量 -1.5% CheckpointBench:成本低 65%,质量 -0.1% GitHub @github 4.9 percentage points higher verified task quality. 67% lower estimated cost. Project HydraFusion delivered those results against Claude Opus 5 on Terminal-Bench 2.1 in controlled offline evaluations. HydraFusion orchestrates the models and workflow for each coding task. You select it like any other model. ⬇️ github.blog/ai-and-ml/gith… 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 2 👀 502 📊 1 ⚡ Powered by xgo.ing