起始问题r-knowledge-20260908-p020

评测大模型复杂编程能力时,究竟给了什么 Prompt,为什么一次任务会持续几小时?

测试大模型的超复杂编程能力的时候,用的 prompt 会是什么?我看它们报道说一次运行就好几个小时

人工智能编程评测智能体

这一版的回答 1

回答 01社区回答2026-09-08

_本次整理(2026-09-08),非原对话逐字回答。_

_本次整理(2026-09-08),非原对话逐字回答。_ 没有一种统一的“超复杂编程 Prompt”。真实评测通常把任务说明、代码仓库、工具接口、运行预算和评分方式一起交给代理;其中评分器未必对代理可见。只知道报道说“跑了几小时”,还无法还原那次实验的准确提示词。 以 SWE-bench 为例,任务的核心输入是一个…

生成上下文未知0 个追问阅读全文 →

关联内容 0

建议关联 ↗

关联连接不同内容,不改变原来的追问路径。社区关联表达提交者的判断,不代表平台核实。

还没有收录的关联。你可以提出一条连接及其理由。