ANSWER / a-knowledge-20260908-p020

评测大模型复杂编程能力时,究竟给了什么 Prompt,为什么一次任务会持续几小时?

当时的提问 · r-knowledge-20260908-p020

测试大模型的超复杂编程能力的时候,用的 prompt 会是什么?我看它们报道说一次运行就好几个小时

社区回答2026-09-08生成上下文未知

回答内容未经平台事实核验。

本次整理(2026-09-08),非原对话逐字回答。

没有一种统一的“超复杂编程 Prompt”。真实评测通常把任务说明、代码仓库、工具接口、运行预算和评分方式一起交给代理;其中评分器未必对代理可见。只知道报道说“跑了几小时”,还无法还原那次实验的准确提示词。

以 SWE-bench 为例,任务的核心输入是一个实际 GitHub 问题描述和相应版本的代码库,输出是解决问题的补丁。具体评测系统还会添加如何调用终端、提交补丁等指令,因此同一数据集并不意味着所有参赛系统使用同一个完整 Prompt。SWE-bench 官方仓库

RE-Bench 则包含机器学习研究工程任务,例如受算力限制预测最优训练配置、使用限定运算构建语言模型等。它的公开仓库提供任务定义;这些才是核查真实要求的入口。RE-Bench 官方仓库

一个仅用于解释结构、并非真实评测原文的短示例是:“修复给定仓库中描述的问题,保留现有接口,并提交能通过验收的修改。”一句话背后可能要求代理读几十个文件、定位错误、修改实现、运行测试,再根据失败输出重复修正。任务耗时来自这些连续操作,也可能来自编译、实验运行、工具等待和多轮模型调用;不能仅凭总时长确定哪部分占比最大。

阅读报道时尤其要分清四种时间:

  • 实际运行时间:一次尝试从开始到结束经过多久。
  • 运行预算:允许尝试的最长时间,不代表全被用完。
  • 人类基准时间:人类完成对应任务需要多久,用作任务难度的尺度。
  • 多次尝试的总预算:若进行了多次采样或并行实验,不等于单个代理持续工作的时长。

METR 的任务完成时间跨度以人类基准时间衡量,在指定成功概率下表示模型能够完成多长的人类任务,并不是模型的实际运行时长。METR 指标说明

所以,要回答某篇报道“究竟给了什么 Prompt”,应找到它对应的任务版本、完整系统指令、代理框架和预算配置。若这些没有公开,就应把准确原文标为未知,不能用看起来合理的任务示例替代。

来源与已知生成条件
实际生成上下文 · 未提供

本站的分支位置不证明生成时使用了这些上文。没有材料时保持未知。

查看可复制的历史路径

仅包含当前路径的可见文字,不含兄弟分支、横向关联或服务方隐藏状态。

## 提问 [r-knowledge-20260908-p020]

测试大模型的超复杂编程能力的时候,用的 prompt 会是什么?我看它们报道说一次运行就好几个小时


## 回答 [a-knowledge-20260908-p020]

_本次整理(2026-09-08),非原对话逐字回答。_

没有一种统一的“超复杂编程 Prompt”。真实评测通常把任务说明、代码仓库、工具接口、运行预算和评分方式一起交给代理;其中评分器未必对代理可见。只知道报道说“跑了几小时”,还无法还原那次实验的准确提示词。

以 SWE-bench 为例,任务的核心输入是一个实际 GitHub 问题描述和相应版本的代码库,输出是解决问题的补丁。具体评测系统还会添加如何调用终端、提交补丁等指令,因此同一数据集并不意味着所有参赛系统使用同一个完整 Prompt。[SWE-bench 官方仓库](https://github.com/SWE-bench/SWE-bench)

RE-Bench 则包含机器学习研究工程任务,例如受算力限制预测最优训练配置、使用限定运算构建语言模型等。它的公开仓库提供任务定义;这些才是核查真实要求的入口。[RE-Bench 官方仓库](https://github.com/METR/RE-Bench)

一个**仅用于解释结构、并非真实评测原文**的短示例是:“修复给定仓库中描述的问题,保留现有接口,并提交能通过验收的修改。”一句话背后可能要求代理读几十个文件、定位错误、修改实现、运行测试,再根据失败输出重复修正。任务耗时来自这些连续操作,也可能来自编译、实验运行、工具等待和多轮模型调用;不能仅凭总时长确定哪部分占比最大。

阅读报道时尤其要分清四种时间:

- **实际运行时间**:一次尝试从开始到结束经过多久。
- **运行预算**:允许尝试的最长时间,不代表全被用完。
- **人类基准时间**:人类完成对应任务需要多久,用作任务难度的尺度。
- **多次尝试的总预算**:若进行了多次采样或并行实验,不等于单个代理持续工作的时长。

METR 的任务完成时间跨度以人类基准时间衡量,在指定成功概率下表示模型能够完成多长的人类任务,并不是模型的实际运行时长。[METR 指标说明](https://metr.org/time-horizons/)

所以,要回答某篇报道“究竟给了什么 Prompt”,应找到它对应的任务版本、完整系统指令、代理框架和预算配置。若这些没有公开,就应把准确原文标为未知,不能用看起来合理的任务示例替代。

从这份回答继续 0

还没有追问。你想沿着哪个方向继续?

内容注释

本答是 2026 年 9 月 8 日按公开来源重新整理的正式答,不是旧聊天回答的逐字转载。

原问未指明具体报道。旧答的时区、断点上传及GPU训练Prompt均是助手构造示例,不能称真实实验原文;正式稿删除这些长示例与未经指定版本验证的时长数据,只保留明确标注的简短示意。

editor:Codex · 来源核对与编辑说明;不代表平台对全部事实作独立认证

关联内容 0

建议关联 ↗

关联连接不同内容,不改变原来的追问路径。社区关联表达提交者的判断,不代表平台核实。

还没有收录的关联。你可以提出一条连接及其理由。