任何AI模型是否会在2026年12月31日前达到聊天机器人竞技场得分1600或更高?当前'是'的市场隐含概率:22%。探索实时预测市场。
连接钱包交易 · 无钱包?支持通行密钥登录 · /subscribe 免费提醒
聊天机器人竞技场约在2023年出现,作为封闭式AI基准测试的民间替代方案,允许社区通过盲测对比来评估模型质量。这种众包方法因能准确反映真实用户偏好而获得信誉,其影响力已经足够大,使得主要实验室——OpenAI、Anthropic、Google、Meta——密切关注其排名。竞技场采用ELO风格评级系统,其中模型相互竞争,随着新模型推出和用户投票模式演变而不断变化。达到1600分代表进入极精英阶层;1500到1600分之间的差距反映了巨大的能力差异,每增加一分都比之前更加困难。支持进展的因素包括快速的模型发布周期、不断增加的模型规模和训练数据,以及持续的架构创新。22%的市场隐含概率反映了交易者对任何模型是否能在年底前突破1600分的怀疑,表明市场预期基准测试进展停滞或改进轨迹缓慢。然而,AI能力提升的速度仍然很快,整个2026年将定期有新模型发布。
聊天机器人竞技场在2023年出现,作为封闭式AI基准测试的民间替代方案,允许社区通过盲测对比来评估模型质量。这种众包方法因能准确反映真实用户偏好而获得信誉,其影响力已经足够大,使得主要实验室——OpenAI、Anthropic、Google、Meta——积极跟踪其排名。竞技场采用ELO风格评级系统,模型相互竞争,随着新版本推出和用户投票模式演变而不断变化。达到1600分代表进入极精英阶层;1500到1600分之间的差距反映了指数级难以弥合的能力差异,每增加一分都需要付出显著更大的努力。支持裁定为是的因素包括:快速的模型发布周期(主要实验室每3-6个月发布新版本)、不断增加的模型规模和训练数据多样性、多模态系统和推理能力的持续架构创新,以及在整个行业激励能力进步的激烈竞争压力。OpenAI的GPT-4系列、Anthropic的Claude系列和Google的Gemini都在竞技场上取得了稳定进展,突破性发布——如下一代推理系统或真正的多模态架构——可能会将新进入者推向1600分以上。反之,支持裁定为否的因素包括:随着评估者以最近的高表现为锚点,竞技场基准可能正在经历饱和或分数膨胀,使1600成为随着能力提升而不断后退的动目标;从1550到1600的跳跃可能需要根本性的新能力,而不是增量缩放改进;主要实验室可能会优先考虑安全性、可靠性和专业领域而非纯粹的竞技场分数。历史上,大语言模型的进展在公开信息中看起来是指数级的,但在仔细审视下往往会趋于平缓——GPT-3.5和GPT-4之间的差距感觉是变革性的,但随后的步骤更加谨慎和专业化。22%的市场隐含概率表明交易者总体持怀疑态度:市场对大约五分之一的可能性定价,反映出对当前发展轨迹是否能在2026年剩余几个月内突破该基准的怀疑。这意味着市场参与者要么预期进展速度比历史趋势所示的要慢,要么他们正在考虑减缓精英性能层面差异化的结构性上限效应。
如果任何AI模型在2026年12月31日前达到聊天机器人竞技场得分1600或更高,市场将裁定为是。裁定基于截止日期时公开可得的竞技场排行榜数据。
预测市场将交易者的预期聚合为实时概率估计。在 Polymarket Trade 上,每个市场问题根据特定事件结果裁定为 YES 或 NO;交易者购买他们认为会以正面结果裁定的一方的份额。价格范围从 0¢(确定 NO)到 100¢(确定 YES),自然反映人群隐含的 YES 概率。本页面为来自搜索引擎的读者总结市场状态;如需实时交易(下单、查看订单簿深度、执行交易),请打开上方链接的完整交互页面。