El modelo Claude tiene una probabilidad implícita de 22% de obtener 45%+ en Humanity's Last Exam, que finaliza el 30 de junio. Volumen de $105 en 24h. Operá en vivo en Polymarket a través de Polymarket Trade.
Este mercado ha sido archivado. El contenido histórico se conserva a continuación.
Humanity's Last Exam es una evaluación de referencia diseñada para evaluar el razonamiento avanzado de inteligencia artificial en múltiples dominios problemáticos y disciplinas. Los modelos Claude de Anthropic han mostrado un desempeño sólido en evaluaciones académicas en el pasado, pero esta evaluación particular se destaca por su rigor y amplitud. La probabilidad implícita del mercado del 22% refleja un escepticismo sustancial de los operadores respecto a que Claude alcance el umbral del 45% antes de la fecha límite del 30 de junio. Este precio sugiere que el mercado considera la tarea como legítimamente difícil—un desafío significativo para los modelos de frontera, pero no un hito imposible. El volumen de negociación relativamente bajo de $105 en las últimas 24 horas es típico para predicciones sobre capacidades de IA, donde la atención general se concentra en lanzamientos de modelos principales y evaluaciones ampliamente publicitadas en lugar de evaluaciones especializadas. Un modelo Claude que logre una puntuación del 45% representaría un progreso significativo en tareas de razonamiento desafiantes, señalando que los sistemas de inteligencia artificial de frontera están avanzando hacia una capacidad autónoma más amplia. Las probabilidades actuales del 22% implican aproximadamente una confianza de 1 en 5 del mercado en este resultado, consistente con cómo los mercados de predicciones cotizan hitos estrechos y técnicamente exigentes.
Humanity's Last Exam representa un esfuerzo ambicioso para medir el razonamiento avanzado de inteligencia artificial en múltiples dominios problemáticos y disciplinas. A diferencia de las evaluaciones especializadas que se enfocan en áreas específicas de conocimiento (matemáticas, comprensión del lenguaje, generación de código), esta evaluación combina desafíos de razonamiento diversos en una sola evaluación integral. El umbral del 45% es un hito significativo—sustancialmente por encima del desempeño aleatorio o de referencia, pero por debajo de los niveles de desempeño de expertos humanos en la suite de evaluación completa. Los factores que podrían impulsar a Claude hacia el resultado positivo incluyen la iteración rápida en el programa de investigación de Anthropic, mejoras demostradas en versiones de modelos recientes, e historial documentado de Claude en tareas de razonamiento complejo. Si Anthropic lanza una nueva variante de modelo o una mejora importante de capacidad antes de la fecha límite del 30 de junio, alcanzar el 45% se vuelve más plausible. Además, técnicas de ajuste fino dirigidas o técnicas de indicaciones avanzadas diseñadas específicamente para la estructura de la evaluación podrían desbloquear ganancias de desempeño ocultas más allá de lo que sugieren las capacidades del modelo base. Por el contrario, varios factores respaldan las probabilidades actuales bajas. Primero, Humanity's Last Exam está intencionalmente diseñada para ser difícil—los creadores de evaluaciones típicamente incluyen problemas que desafían incluso a los modelos de frontera. Segundo, el umbral del 45% es genuinamente exigente, requiriendo que el modelo resuelva casi la mitad de un conjunto curado de problemas difíciles. Tercero, la hoja de ruta de investigación de Anthropic no está garantizada de priorizar esta evaluación en particular o entregar rupturas importantes de capacidad antes del 30 de junio; la empresa puede enfocarse en otras líneas de productos o direcciones de investigación. Cuarto, los modelos de inteligencia artificial de frontera a menudo muestran rendimientos decrecientes en evaluaciones de razonamiento—cada punto porcentual de mejora se vuelve más difícil a medida que el desempeño se acerca a los niveles de expertos humanos. El contexto reciente revela un conservadurismo más amplio del mercado de predicciones sobre hitos de capacidades de IA. A medida que los modelos de lenguaje grandes se acercan al desempeño a nivel humano en dominios específicos, los operadores han cotizado mejoras cada vez más marginales de manera más escéptica. El volumen de negociación mínimo ($105 en 24 horas) confirma que este mercado se sitúa en el extremo de nicho de los mercados de predicciones de IA, atrayendo principalmente a entusiastas de la investigación en IA en lugar del público comercial más amplio. La probabilidad del 22% representa un consenso del mercado de que el desempeño revolucionario es posible pero genuinamente improbable. Los operadores están señalando: esperen que Claude no alcance el 45%, pero manténganse abiertos a una sorpresa al alza si Anthropic entrega un lanzamiento importante o una ruptura de capacidad entre ahora y el 30 de junio. Este precio es consistente con cómo los mercados de predicciones típicamente evalúan hitos estrechos y técnicamente exigentes que dependen de cronogramas de investigación específicos de la empresa y decisiones de lanzamiento.
El mercado se resuelve como SÍ si algún modelo Claude de Anthropic logra al menos 45% en Humanity's Last Exam antes del 30 de junio de 2026. La resolución requiere un anuncio público creíble de los resultados por parte de Anthropic o de los creadores de la evaluación.
Los mercados de predicciones agregan las expectativas de los operadores en estimaciones de probabilidad en tiempo real. En Polymarket Trade, cada pregunta de mercado se resuelve como YES o NO según el resultado específico de un evento; los operadores compran participaciones del lado que creen que se resolverá positivamente. Los precios van desde 0¢ (NO seguro) hasta 100¢ (YES seguro) y reflejan naturalmente la probabilidad implícita por la multitud de que sea YES. Esta página resume el estado del mercado para los lectores que llegan desde búsquedas; para operar en vivo (colocar órdenes, ver la profundidad del libro de órdenes, ejecutar una operación), abre la página interactiva completa enlazada arriba.