原标题:《OpenAI's GPT-6 Astra on ARC-AGI-3》 评分: 157 | 作者: vignesh_warar 💭 解个蛇棋最短步数,就算 AGI 了? 🎯 讨论背景 ARC-AGI-3 是 ARC Prize(一个面向抽象推理能力的竞赛项目)推出的第三版基准,前两版因为模型进步太快而被认为已经饱和。文章讨论 OpenAI 的 GPT-6 Astra 在该基准上的成绩,以及官方 harness(评测框架)是否会丢掉旧上下文、OpenAI 是否通过 compaction(上下文压缩)和多轮重试放大了表现。评论里还提到人类受试者的付费方式、模型 compute 成本、以及 semi-private set(半私有测试集)之类的细节,说明这类评测不仅是在比答题能力,也是在比谁更会刷分。围绕这些分数,讨论迅速转向 AGI、IQ、Turing test、机器人任务和现实工作能力,核心问题是这种抽象 puzzle 到底代表多少通用智能。 📌 讨论焦点 AGI 定义与智力测量 不少评论认为 AGI 这个词本身就很松散,最多只能说模型在某些可测能力上更强了。有人把它拿来类