起始问题提问原文测试大模型的超复杂编程能力的时候,用的 prompt 会是什么?我看它们报道说一次运行就好几个小时 提交本题答案提问原文与版本这一版的回答 · 1回答 1 · 社区回答_本次整理(2026-09-08),非原对话逐字回答。_ 没有一种统一的“超复杂编程 Prompt”。真实评测通常把任务说明、代码仓库、工具接口、运行预算和评分方式一起交给代理;其中评分器未必对代理可见。只知道报道说“跑了几小时”,还无法还原那次实验的准确提示词。 以 SWE阅读全文 →