Claude 模型在人类最后的考试中获得 45%+ 分数的市场隐含概率为 22%,市场截止日期为 6 月 30 日。24 小时交易量 $105。在 Polymarket 上通过 Polymarket Trade 实时交易。
该市场已归档。下方保留历史内容。
人类最后的考试是一个基准评估,旨在评估先进 AI 跨越多个问题领域和学科的推理能力。Anthropic 的 Claude 模型在过去的学术基准上表现强劲,但这一特定评估以其严谨性和广泛性著称。22% 的市场概率反映了交易者对 Claude 在 6 月 30 日截止日期前达到 45% 阈值的实质性怀疑。这一定价表明市场认为该任务确实困难——对前沿模型而言是一个有意义的挑战,但并非不可能的里程碑。过去 24 小时 $105 的相对较低交易量对于 AI 能力预测来说是典型的,其中主流关注集中在主要模型发布和广泛公开的基准上,而不是专业评估。Claude 模型达到 45% 的分数将代表在具有挑战性的推理任务上的有意义的进展,表明前沿 AI 系统正在向更广泛的自主能力迈进。目前的 22% 市场概率暗示大约五分之一的市场信心,与预测市场如何为狭隘、技术上要求高的里程碑定价是一致的。
人类最后的考试代表了一项雄心勃勃的努力,旨在衡量先进 AI 跨越多个问题领域和学科的推理能力。与专注于特定知识领域(数学、语言理解、代码生成)的专业基准不同,这一评估将多种推理挑战融合成一个综合评估。45% 的阈值是一个有意义的里程碑——大幅高于随机或基准性能,但低于人类专家在完整评估套件上的表现水平。 可能推动 Claude 向是的因素包括 Anthropic 研究项目中的快速迭代、最近模型版本中的明确改进,以及 Claude 在复杂推理任务上的已证实的记录。如果 Anthropic 在 6 月 30 日截止日期前发布新的模型变体或重大能力改进,达到 45% 就更有可能。此外,针对基准结构专门设计的有针对性的微调或高级提示技术可能会解锁超出基线模型能力所表明的隐藏性能收益。 相反,几个因素支持目前的低概率。首先,人类最后的考试有意设计为困难——基准创建者通常包括即使是前沿模型也会挑战的问题。其次,45% 的阈值是真正的要求,需要模型解决精心策划的困难问题集的近一半。第三,Anthropic 的研究路线图不一定优先考虑这个特定的基准或在 6 月 30 日前交付重大能力突破;公司可能会关注其他产品线或研究方向。第四,前沿 AI 模型在推理基准上往往显示出递减收益——随着性能接近人类专家水平,每一个百分点的改进变得更加困难。 最近的背景揭示了预测市场对 AI 能力里程碑的更广泛保守态度。随着大型语言模型在特定领域接近人类水平的性能,交易者对日益边际的改进进行了更加怀疑的定价。最少的交易量(24 小时内 $105)确认了这个市场位于 AI 预测市场的利基端,主要吸引 AI 研究爱好者而不是更广泛的交易公众。 22% 的概率代表了市场共识,认为突破性性能是可能的但真正不太可能。交易者的信号是:预期 Claude 未能达到 45%,但如果 Anthropic 在现在和 6 月 30 日之间交付重大发布或能力突破,则保持对上升惊喜的开放。这一定价与预测市场通常如何评估狭隘、技术上要求高的里程碑是一致的,这些里程碑取决于特定公司的研究时间表和发布决策。
如果任何 Anthropic Claude 模型在 2026 年 6 月 30 日前在人类最后的考试中达到至少 45%,则市场裁定为是。裁定需要 Anthropic 或基准创建者的可信公开结果公告。
预测市场将交易者的预期聚合为实时概率估计。在 Polymarket Trade 上,每个市场问题根据特定事件结果裁定为 YES 或 NO;交易者购买他们认为会以正面结果裁定的一方的份额。价格范围从 0¢(确定 NO)到 100¢(确定 YES),自然反映人群隐含的 YES 概率。本页面为来自搜索引擎的读者总结市场状态;如需实时交易(下单、查看订单簿深度、执行交易),请打开上方链接的完整交互页面。