Claude在《人类最后考试》中获得50%以上成绩的市场隐含概率为13%,24小时成交额$148,流动性深度$3.3K。市场将于6月30日裁定。通过Polymarket Trade在Polymarket上交易。
该市场已归档。下方保留历史内容。
《人类最后考试》是一项严谨的基准测试,旨在评估先进AI系统的推理能力和基础知识是否达到专家人类水平。预测市场目前给出Claude在2026年6月30日前在这项综合基准测试中获得至少50%成绩的市场隐含概率仅为13%。这一低概率表明交易者认为该基准测试确实存在难度,并相信即使有计划的更新,Claude的当前能力也可能无法达到该阈值。市场定价反映出交易者对AI能力改进速度和考试难度水平的怀疑。在13%的市场隐含概率下,市场实际上是在表示Claude达到50%的概率约为八分之一——一个有意义但不太可能的结果。这表明更广泛的交易社群认为这样的成绩取决于要么出现意外的推理突破,要么考试内容与Claude的架构优势产生有利的对齐。
《人类最后考试》是一项严谨的基准测试,旨在评估先进AI系统是否具有与专家人类水平相当或超过的通用推理、知识和问题解决能力。该测试故意设计得全面,跨越多个知识领域和认知挑战,为AI评估设置了一个很高的标准。与测试狭隘的模式匹配或记忆力的基准测试不同,《人类最后考试》需要可演示的推理能力——这些任务需要理解、推断和综合能力。市场的13%定价反映了交易者的共识,即这是一项困难而有意义的测试,而非低门槛。多个因素可能推动市场向'是'方向发展。首先,Anthropic在每个Claude发布周期中都展示了持续的能力改进,特别是在推理密集型任务中。如果Claude 4.0或重大更新在6月30日前发布,并在多步推理、思路链执行或数学问题解决中实现实质性改进,可能会使其成绩明显接近50%。其次,该基准测试的结构可能无意中比预期更有利于Claude的架构优势——深层上下文窗口、指令遵循或系统推理。第三,如果测试创建者提前发布考试内容,Anthropic工程师可能会优化Claude针对该特定测试的方法。第四,集成或多次通过策略可能会聚合成强大的性能,即使单次通过性能较弱。支持'否'的重要阻力因素确实存在。《人类最后考试》明确设计用来测试前沿AI能力并识别当前系统与人类专业知识之间的差距。50%的成绩将意味着Claude在全面测试中与专家人类具有竞争力——这一主张在2026年中期仍被业界广泛认为为时过早。其次,架构或计算限制可能会限制Claude的扩展;原始参数数量并不能自动转化为推理能力。第三,考试创建者有很强的动机来维持严谨性和难度,抵制'基准测试博弈'。第四,即使Claude改进,竞争系统也可能同时改进,而该考试的设计目的是保持领先于AI进展。13%的市场隐含概率表明交易者认为这样的成绩需要要么出现能力方面的意外突破,要么出现有利的考试对齐机遇,要么对'50%'在该背景下的含义进行重新评估。
如果任何Anthropic Claude模型在2026年6月30日之前在《人类最后考试》中获得至少50%的成绩,本预测市场将裁定为'是',否则裁定为'否'。评分结果必须由考试创建者以透明的评分方法发布。
预测市场将交易者的预期聚合为实时概率估计。在 Polymarket Trade 上,每个市场问题根据特定事件结果裁定为 YES 或 NO;交易者购买他们认为会以正面结果裁定的一方的份额。价格范围从 0¢(确定 NO)到 100¢(确定 YES),自然反映人群隐含的 YES 概率。本页面为来自搜索引擎的读者总结市场状态;如需实时交易(下单、查看订单簿深度、执行交易),请打开上方链接的完整交互页面。