GPT tiene una probabilidad de mercado de 29% de superar el 50% en el Último Examen de la Humanidad antes del 30 de junio, con un volumen de $136 en 24 horas. Negocia en vivo en Polymarket a través de Polymarket Trade.
Este mercado ha sido archivado. El contenido histórico se conserva a continuación.
'Último Examen de la Humanidad' es un sistema de evaluación diseñado para analizar los modelos GPT de OpenAI en razonamiento, resolución de problemas, comprensión y tareas cognitivas, con una evaluación formal esperada para el 30 de junio de 2026. La probabilidad de mercado de 29% indica que los operadores son bastante escépticos de que cualquier iteración actual de GPT logre al menos una puntuación de 50% en esta evaluación. Este precio refleja la evaluación de mercado de que las versiones actuales de GPT enfrentan limitaciones significativas en razonamiento abstracto, inferencia compleja multi-paso, reconocimiento de matices u otras dimensiones que este sistema de evaluación específicamente aborda. La liquidez de mercado relativamente baja ($1,730 total, $136 volumen en 24 horas) es típica para evaluaciones técnicas de capacidades de IA, que atraen principalmente a investigadores y especialistas en IA en lugar de participantes del mercado convencionales. Históricamente, los avances en desempeño de IA en sistemas de evaluación de razonamiento integral han llegado gradualmente en lugar de a través de avances repentinos, y el precio de mercado parece reflejar esta perspectiva medida. La fecha límite del 30 de junio proporciona una ventana de resolución definida para lo que muchos ven como una prueba genuina de las capacidades actuales de razonamiento y comprensión de GPT.
Último Examen de la Humanidad parece ser un sistema de evaluación riguroso que se enfoca en limitaciones que persisten incluso en modelos de lenguaje de última generación. Si bien OpenAI ha realizado avances rápidos en capacidad de modelos, cada nueva generación típicamente alcanza techos de desempeño en sistemas de evaluación diseñados para probar razonamiento genuino en lugar de coincidencia de patrones. La probabilidad de mercado de 29% probablemente refleja la convicción de los operadores de que GPT no llegará a 50% en parte porque los sistemas de evaluación de razonamiento históricamente han sido donde los modelos de lenguaje se estancan más. Inferencia multi-paso, manejo de tipos de problemas novedosos, y mantener precisión a través de cadenas largas de razonamiento son áreas donde incluso los modelos más avanzados muestran brechas medibles. Varios factores podrían impulsar este mercado hacia SÍ. Un nuevo lanzamiento de modelo entre ahora y el 30 de junio con una arquitectura de razonamiento sustancialmente mejorada podría cambiar las expectativas significativamente. Los esfuerzos continuos de escalado de OpenAI y mejoras en entrenamiento podrían reducir la brecha. Si el examen tiene dominios específicos donde GPT ya muestra fortaleza—ciertos problemas matemáticos, tareas de codificación, o razonamiento específico del dominio—un umbral de 50% podría ser alcanzable. Por el contrario, el escepticismo del mercado se justifica por varios factores de NO. Los sistemas de evaluación de razonamiento integral son notoriamente difíciles de resolver; muchos requieren manejo de ambigüedad, pensamiento abstracto, y formulaciones de problemas novedosos que prueben comprensión verdadera en lugar de memorización. Si el examen pondera estas dimensiones fuertemente, 50% se convierte en una barra alta. Los creadores del sistema de evaluación pueden haber diseñado específicamente la prueba para identificar las debilidades de GPT, no sus fortalezas. Además, la metodología de puntuación importa—si el crédito parcial es limitado, se requieren respuestas exactas, o si las preguntas ambiguas se califican severamente, la tasa de aprobación podría fácilmente mantenerse por debajo de 50%. Históricamente, los sistemas de evaluación de IA muestran un patrón: los modelos típicamente se estancan a 60-80% en sistemas de evaluación establecidos en lugar de alcanzar 95%+, y los nuevos sistemas de evaluación diseñados para ser genuinamente desafiantes a menudo ven desempeño inicial en el rango de 30-50%. El precio actual de mercado de 29% para SÍ puede estar incorporando tanto la dificultad real de la tarea como la incertidumbre del mercado sobre cuáles son realmente los criterios de evaluación. Con solo $136 en volumen de 24 horas, este es un mercado delgado, lo que significa que el precio puede no reflejar completamente toda la información disponible. Los operadores institucionales o investigadores con conocimiento directo de la dificultad del examen tendrían fuertes incentivos para comerciar aquí, y el volumen delgado sugiere que o carecen de convicción o están esperando señales más claras. La fecha límite del 30 de junio está aproximadamente a seis meses, dándole a OpenAI tiempo para uno o potencialmente dos lanzamientos de modelos, pero las mejoras arquitectónicas importantes dentro de esa ventana típicamente no están garantizadas. La probabilidad de mercado de 29% es esencialmente decir: 'Es más probable que no, GPT seguirá quedando corto en 50% en este sistema de evaluación de razonamiento integral para mediados de 2026,' lo cual se alinea con patrones históricos y limitaciones conocidas en modelos de generación actual.
El mercado se resuelve con SÍ si el GPT de OpenAI logra al menos 50% en el Último Examen de la Humanidad para la fecha de evaluación del 30 de junio de 2026. La resolución depende del anuncio oficial de resultados por parte de los creadores del sistema de evaluación.
Los mercados de predicciones agregan las expectativas de los operadores en estimaciones de probabilidad en tiempo real. En Polymarket Trade, cada pregunta de mercado se resuelve como YES o NO según el resultado específico de un evento; los operadores compran participaciones del lado que creen que se resolverá positivamente. Los precios van desde 0¢ (NO seguro) hasta 100¢ (YES seguro) y reflejan naturalmente la probabilidad implícita por la multitud de que sea YES. Esta página resume el estado del mercado para los lectores que llegan desde búsquedas; para operar en vivo (colocar órdenes, ver la profundidad del libro de órdenes, ejecutar una operación), abre la página interactiva completa enlazada arriba.