Derechos de autor 2026 Tecnociencia

Esta obra está bajo una licencia internacional Creative Commons Atribución-NoComercial-CompartirIgual 4.0.
Este estudio presenta un benchmark textual para comparar nueve modelos comerciales de lenguaje de gran escala en la resolución de problemas de Mecánica Clásica. Se empleó un total de 42 ítems auto-contenidos y sin dependencia explícita de diagramas, extraídos de materiales abiertos de MIT OpenCourseWare correspondientes a 2005 y 2016. Los modelos evaluados pertenecieron a tres proveedores: OpenAI, Anthropic y Google Gemini. Cada problema se presentó mediante un mismo prompt estructurado con respuesta final, resumen breve del razonamiento, ecuaciones, unidades, nivel de confianza. La corrida completa produjo 378 respuestas utilizables. La referencia de corrección se construyó en dos etapas: consenso numérico para 22 ítems y curación manual para 19 casos sin consenso; un ítem permaneció ambiguo por dependencia residual de figuras ausentes. El pipeline alcanzó 100% de éxito final, aunque 29 salidas truncadas requirieron
recuperación a nivel de parser. En acuerdo heurístico con la referencia curada, Gemini obtuvo el mejor rendimiento agregado por proveedor (43.7%; 55/126), mientras que gemini-3.1-pro-preview alcanzó el mejor resultado a nivel de modelo (61.9%; 26/42). Anthropic produjo las respuestas más extensas y lentas, y gemini-3-flash-preview fue el modelo más veloz. Los hallazgos muestran que los LLMs ya apoyan evaluaciones reproducibles en física sin reemplazar expertos.