Claude con probabilidad de mercado del 13% de anotar 50%+ en el último examen de la humanidad, con volumen de $148 en 24h y $3.3K de liquidez. Cierra el 30 de junio. Opera en Polymarket a través de Polymarket Trade.
Este mercado ha sido archivado. El contenido histórico se conserva a continuación.
El último examen de la humanidad es un benchmark riguroso diseñado para evaluar el razonamiento avanzado de IA y el conocimiento general a niveles de expertos humanos. El mercado actualmente asigna una probabilidad de mercado del 13% para que Claude obtenga al menos 50% en esta prueba integral antes del 30 de junio de 2026. Esta baja probabilidad sugiere que los operadores consideran el benchmark genuinamente difícil y creen que las capacidades actuales de Claude, incluso con actualizaciones planificadas, podrían no alcanzar el umbral. El precio refleja escepticismo tanto sobre el ritmo de mejora de las capacidades de IA como sobre el nivel de dificultad del examen. Con una probabilidad implícita del 13%, el mercado esencialmente dice que hay aproximadamente una probabilidad de 1 entre 8 de que Claude alcance 50% — un resultado significativo pero improbable. Esto sugiere que la comunidad comercial más amplia ve tal desempeño como condicionado a avances inesperados en el razonamiento o a una alineación favorable entre el contenido del examen y las fortalezas arquitectónicas de Claude.
El último examen de la humanidad es un benchmark riguroso diseñado para evaluar si los sistemas avanzados de IA poseen capacidades generales de razonamiento, conocimiento y resolución de problemas comparables o superiores a los niveles de expertos humanos. La prueba es intencionalmente integral, abarcando múltiples dominios de conocimiento y desafíos cognitivos, lo que la convierte en un estándar alto para la evaluación de IA. A diferencia de los benchmarks que prueban reconocimiento de patrones estrecho o memorización, el último examen de la humanidad requiere razonamiento demostrable — tareas que exigen comprensión, inferencia y síntesis. El precio del mercado del 13% refleja el consenso de los operadores de que esta es una prueba difícil y significativa, no un obstáculo fácil. Varios factores podrían impulsar el mercado hacia SÍ. Primero, Anthropic ha demostrado mejoras consistentes de capacidades en cada ciclo de lanzamiento de Claude, particularmente en tareas intensivas en razonamiento. Si Claude 4.0 o una actualización importante llega antes del 30 de junio con ganancias sustanciales en razonamiento multisecuencial, ejecución de cadena de pensamiento o resolución de problemas matemáticos, podría acercarse materialmente al 50%. Segundo, la estructura del benchmark podría inadvertidamente favorecer las fortalezas arquitectónicas de Claude — ventanas de contexto profundo, seguimiento de instrucciones o razonamiento sistemático — más de lo anticipado. Tercero, si los creadores de pruebas publican el examen con anticipación, los ingenieros de Anthropic podrían optimizar el enfoque de Claude hacia esa prueba específica. Cuarto, las estrategias de conjunto o multipase podrían agregarse a un desempeño fuerte incluso si el desempeño de un solo paso es más débil. En contra de SÍ, existen vientos en contra significativos. El último examen de la humanidad fue explícitamente diseñado para evaluar las capacidades fronterizas de IA e identificar brechas entre los sistemas actuales y la experiencia humana. Una puntuación del 50% implicaría que Claude es competitivo con expertos humanos en una prueba integral — una afirmación que la industria ampliamente considera prematura a mediados de 2026. Segundo, las limitaciones arquitectónicas o computacionales pueden limitar el escalado de Claude; el recuento bruto de parámetros no se traduce automáticamente en capacidad de razonamiento. Tercero, los creadores de pruebas tienen fuertes incentivos para mantener el rigor y la dificultad, resistiendo el «gaming de benchmarks». Cuarto, incluso si Claude mejora, los sistemas competidores pueden mejorar simultáneamente, y el examen está diseñado para mantenerse por delante del progreso de IA. Las probabilidades del 13% implican que los operadores creen que tal puntuación requiere avances inesperados en capacidades, suerte favorable en la alineación del examen, o una reevaluación de lo que significa «50%» en contexto.
El mercado se resuelve como SÍ si cualquier modelo Claude de Anthropic obtiene al menos 50% en el último examen de la humanidad antes del 30 de junio de 2026. De lo contrario, se resuelve como NO. Los resultados deben ser publicados por los creadores del examen con una metodología de calificación transparente.
Los mercados de predicciones agregan las expectativas de los operadores en estimaciones de probabilidad en tiempo real. En Polymarket Trade, cada pregunta de mercado se resuelve como YES o NO según el resultado específico de un evento; los operadores compran participaciones del lado que creen que se resolverá positivamente. Los precios van desde 0¢ (NO seguro) hasta 100¢ (YES seguro) y reflejan naturalmente la probabilidad implícita por la multitud de que sea YES. Esta página resume el estado del mercado para los lectores que llegan desde búsquedas; para operar en vivo (colocar órdenes, ver la profundidad del libro de órdenes, ejecutar una operación), abre la página interactiva completa enlazada arriba.