资讯同步 on Nostr: #V2EX ### [分享创造] 给 Codex 做了个自动选模型的 ...
#V2EX
### [分享创造] 给 Codex 做了个自动选模型的 Skill,顺手加了并发调度
Codex 更新 gpt5.6 以来,我一直在手动切模型,每次都自己判断挺烦的。而且 Codex 官方的 Ultra 虽然可以并发,但必须使用 Sol XHigh 。问题是 Sol XHigh 本身就很慢,四只脚一起猛蹬甚至不如合适强度的模型串行……
当然也可以直接对话让 Codex 选择模型和并发,但我发现它又会偏好 Luna low 和 Terra medium ,从真实测评和社区反馈来看,都不是很好的选择。特别是现在 Luna 疯狂降价的情况下,Terra 真的两头不靠。
所以我就做了个 skill `$codex-auto-model-router`,1. 在更低的模型和推理强度上也能智能调度并发,2. 每个子任务根据难度,按照真实测评表现单独选择模型。
它会先分析任务之间的依赖。能安全拆开的部分就并发,涉及共享文件、Git index 、项目配置这些容易打架的资源就串行;每个子任务再单独选择 Luna 、Terra 或 Sol ,而不是全部一起上 Sol XHigh 。
```
任务依赖图
├─ 独立任务 A ─┐
├─ 独立任务 B ─┼─→ 验证并汇总
└─ A 完成后执行 C ─┘
共享文件或资源 → 串行执行
```
模型选择大概是这样:
```
任务
└─ 评估范围、歧义、风险和时延
├─ 重复、普通或确定性任务 → Luna ─┐
├─ 时延敏感任务 → Terra ──────────┼─→ 执行 → 验证
└─ 复杂、高歧义或高风险任务 → Sol ─┘
```
一开始我其实挺低估 Luna 的,只敢用 Luna Low 跑一些完全机械任务。结果 Low 还是经常出错,或者还没做完就停了,搞得我一直觉得 Luna 不太聪明。
后来认真看了一下 CursorBench 3.2 ,才发现问题可能不是 Luna ,而是我一直在用 Low:
* Luna Low:37.6%,单任务成本约 $0.03
* Luna High:56.8%,单任务成本约 $0.16
* Luna Max:61.1%,单任务成本约 $0.39
* Codex 默认的 Sol Medium:60.0%,单任务成本约 $1.95
从 Low 到 High ,正确率直接涨了 19.2 个百分点。Luna Max 甚至略高于 Sol Medium ,但成本只有大约五分之一。
当然 Luna Max 用的 Token 和步骤也多很多,并不是以后所有任务都无脑 Max 。对我来说更实际的结论是:机械任务不需要为了省那一点继续用 Low ,普通任务可以更多交给 Luna High ,只有真正复杂、模糊或者高风险的任务再上 Sol 。
目前的默认逻辑是,但是调用 Skill 的时候可以人工指令覆盖:
```
机械、重复 → Luna Medium
普通有界、常规扫描 → Luna High
大型扫描或审查 → Luna XHigh
大型确定性深度任务 → Luna Max
明确强调低延迟 → Terra High
有界复杂任务 → Sol Medium
高歧义、高耦合或高后果 → Sol High
复杂任务推理或验证失败 → Sol XHigh
```
GitHub:
<
https://github.com/orange-the-weak/codex-auto-model-router>
目前还在继续调整路由规则。基本每天都在用真实项目测试。欢迎试用,也欢迎帮我看看现在的模型分配有没有什么离谱的地方。
测评数据来源:[CursorBench 3.2](
https://cursor.com/de/cursorbench)
https://www.v2ex.com/t/1231691#reply0Published at
2026-08-03 04:21:32 UTCEvent JSON
{
"id": "e7461261f4db03d097bb4b85fc94a1a4e2af5addaa53313f5284052eb0e80a1f",
"pubkey": "2d0154e14033e848b448a971322bfbf4e04a29c377012ee0f5ab66099b56f1ad",
"created_at": 1785730892,
"kind": 1,
"tags": [
[
"t",
"v2ex"
]
],
"content": "#V2EX\n### [分享创造] 给 Codex 做了个自动选模型的 Skill,顺手加了并发调度\n\nCodex 更新 gpt5.6 以来,我一直在手动切模型,每次都自己判断挺烦的。而且 Codex 官方的 Ultra 虽然可以并发,但必须使用 Sol XHigh 。问题是 Sol XHigh 本身就很慢,四只脚一起猛蹬甚至不如合适强度的模型串行……\n\n当然也可以直接对话让 Codex 选择模型和并发,但我发现它又会偏好 Luna low 和 Terra medium ,从真实测评和社区反馈来看,都不是很好的选择。特别是现在 Luna 疯狂降价的情况下,Terra 真的两头不靠。\n\n所以我就做了个 skill `$codex-auto-model-router`,1. 在更低的模型和推理强度上也能智能调度并发,2. 每个子任务根据难度,按照真实测评表现单独选择模型。\n\n它会先分析任务之间的依赖。能安全拆开的部分就并发,涉及共享文件、Git index 、项目配置这些容易打架的资源就串行;每个子任务再单独选择 Luna 、Terra 或 Sol ,而不是全部一起上 Sol XHigh 。\n\n```\n任务依赖图\n├─ 独立任务 A ─┐\n├─ 独立任务 B ─┼─→ 验证并汇总\n└─ A 完成后执行 C ─┘\n\n共享文件或资源 → 串行执行\n```\n\n模型选择大概是这样:\n\n```\n任务\n└─ 评估范围、歧义、风险和时延\n ├─ 重复、普通或确定性任务 → Luna ─┐\n ├─ 时延敏感任务 → Terra ──────────┼─→ 执行 → 验证\n └─ 复杂、高歧义或高风险任务 → Sol ─┘\n```\n\n一开始我其实挺低估 Luna 的,只敢用 Luna Low 跑一些完全机械任务。结果 Low 还是经常出错,或者还没做完就停了,搞得我一直觉得 Luna 不太聪明。\n\n后来认真看了一下 CursorBench 3.2 ,才发现问题可能不是 Luna ,而是我一直在用 Low:\n\n* Luna Low:37.6%,单任务成本约 $0.03\n* Luna High:56.8%,单任务成本约 $0.16\n* Luna Max:61.1%,单任务成本约 $0.39\n* Codex 默认的 Sol Medium:60.0%,单任务成本约 $1.95\n\n从 Low 到 High ,正确率直接涨了 19.2 个百分点。Luna Max 甚至略高于 Sol Medium ,但成本只有大约五分之一。\n\n当然 Luna Max 用的 Token 和步骤也多很多,并不是以后所有任务都无脑 Max 。对我来说更实际的结论是:机械任务不需要为了省那一点继续用 Low ,普通任务可以更多交给 Luna High ,只有真正复杂、模糊或者高风险的任务再上 Sol 。\n\n目前的默认逻辑是,但是调用 Skill 的时候可以人工指令覆盖:\n\n```\n机械、重复 → Luna Medium\n普通有界、常规扫描 → Luna High\n大型扫描或审查 → Luna XHigh\n大型确定性深度任务 → Luna Max\n明确强调低延迟 → Terra High\n有界复杂任务 → Sol Medium\n高歧义、高耦合或高后果 → Sol High\n复杂任务推理或验证失败 → Sol XHigh\n```\n\nGitHub:\n\n\u003chttps://github.com/orange-the-weak/codex-auto-model-router\u003e\n\n目前还在继续调整路由规则。基本每天都在用真实项目测试。欢迎试用,也欢迎帮我看看现在的模型分配有没有什么离谱的地方。\n\n测评数据来源:[CursorBench 3.2](https://cursor.com/de/cursorbench)\nhttps://www.v2ex.com/t/1231691#reply0",
"sig": "211f715707991145f262a2cda32bcc93166f6688327e342d0139ae18e4f24a3298b26e1729500c79ebbe9a7c8a18d12aeebbb9214ed31f91dab3a44a6e4014ff"
}