Nostr'a Katılın
2026-08-03 04:21:32 UTC

资讯同步 on Nostr: #V2EX ### [分享创造] 给 Codex 做了个自动选模型的 ...

#V2EX
### [分享创造] 给 Codex 做了个自动选模型的 Skill,顺手加了并发调度

Codex 更新 gpt5.6 以来,我一直在手动切模型,每次都自己判断挺烦的。而且 Codex 官方的 Ultra 虽然可以并发,但必须使用 Sol XHigh 。问题是 Sol XHigh 本身就很慢,四只脚一起猛蹬甚至不如合适强度的模型串行……

当然也可以直接对话让 Codex 选择模型和并发,但我发现它又会偏好 Luna low 和 Terra medium ,从真实测评和社区反馈来看,都不是很好的选择。特别是现在 Luna 疯狂降价的情况下,Terra 真的两头不靠。

所以我就做了个 skill `$codex-auto-model-router`,1. 在更低的模型和推理强度上也能智能调度并发,2. 每个子任务根据难度,按照真实测评表现单独选择模型。

它会先分析任务之间的依赖。能安全拆开的部分就并发,涉及共享文件、Git index 、项目配置这些容易打架的资源就串行;每个子任务再单独选择 Luna 、Terra 或 Sol ,而不是全部一起上 Sol XHigh 。

```
任务依赖图
├─ 独立任务 A ─┐
├─ 独立任务 B ─┼─→ 验证并汇总
└─ A 完成后执行 C ─┘

共享文件或资源 → 串行执行
```

模型选择大概是这样:

```
任务
└─ 评估范围、歧义、风险和时延
├─ 重复、普通或确定性任务 → Luna ─┐
├─ 时延敏感任务 → Terra ──────────┼─→ 执行 → 验证
└─ 复杂、高歧义或高风险任务 → Sol ─┘
```

一开始我其实挺低估 Luna 的,只敢用 Luna Low 跑一些完全机械任务。结果 Low 还是经常出错,或者还没做完就停了,搞得我一直觉得 Luna 不太聪明。

后来认真看了一下 CursorBench 3.2 ,才发现问题可能不是 Luna ,而是我一直在用 Low:

* Luna Low:37.6%,单任务成本约 $0.03
* Luna High:56.8%,单任务成本约 $0.16
* Luna Max:61.1%,单任务成本约 $0.39
* Codex 默认的 Sol Medium:60.0%,单任务成本约 $1.95

从 Low 到 High ,正确率直接涨了 19.2 个百分点。Luna Max 甚至略高于 Sol Medium ,但成本只有大约五分之一。

当然 Luna Max 用的 Token 和步骤也多很多,并不是以后所有任务都无脑 Max 。对我来说更实际的结论是:机械任务不需要为了省那一点继续用 Low ,普通任务可以更多交给 Luna High ,只有真正复杂、模糊或者高风险的任务再上 Sol 。

目前的默认逻辑是,但是调用 Skill 的时候可以人工指令覆盖:

```
机械、重复 → Luna Medium
普通有界、常规扫描 → Luna High
大型扫描或审查 → Luna XHigh
大型确定性深度任务 → Luna Max
明确强调低延迟 → Terra High
有界复杂任务 → Sol Medium
高歧义、高耦合或高后果 → Sol High
复杂任务推理或验证失败 → Sol XHigh
```

GitHub:

<https://github.com/orange-the-weak/codex-auto-model-router>;

目前还在继续调整路由规则。基本每天都在用真实项目测试。欢迎试用,也欢迎帮我看看现在的模型分配有没有什么离谱的地方。

测评数据来源:[CursorBench 3.2](https://cursor.com/de/cursorbench)
https://www.v2ex.com/t/1231691#reply0