原标题:《Terminal-Bench-Science: Evaluating AI agents on scientific research workflows》 评分: 21 | 作者: matt_d 💭 连科研都能全托管了,还要科学家干嘛? 🎯 讨论背景 Terminal-Bench-Science 是一个把 AI agent 放进科学研究工作流里做评测的 benchmark,目标比传统 coding benchmark 更接近真实科研场景。评论里的人把它和 Claude(Anthropic 的大模型)、Opus 5、Codex(偏代码能力的模型)、Gemini(Google 的大模型)等做对比,关注的不是单纯写代码,而是能否理解数学、科学与实验流程。有人提到 AGENTS.md 这类给 agent 提供操作规则的文档,说明 context engineering 已经开始成为提升效果的重要手段。另一些评论强调 safety 规则在 biomedical science 中可能过头,甚至会拒绝某些看似正常的分析任务。 📌 讨论焦点 真实科研工作流评测 不少评论认为,把评测