Ir al menú de navegación principal Ir al contenido principal Ir al pie de página del sitio
Enviado julio 22, 2026
Publicado 2026-07-30

Artículos

Vol. 8 Núm. 2 (2026): Tecnociencia

Comparación reproducible de modelos de lenguaje en problemas textuales de mecánica clásica mediante un benchmark automatizado


DOI https://doi.org/10.48204/j.tecno.v8n2.a10864

Imagen de portada

Citas
DOI: 10.48204/j.tecno.v8n2.a10864

Publicado: 2026-07-30

Cómo citar

Pérez Castro, O. J., Fernández García, B., Marín Díaz, L. A. y Rodríguez Cisneros , J. M. (2026) «Comparación reproducible de modelos de lenguaje en problemas textuales de mecánica clásica mediante un benchmark automatizado», Tecnociencia, 8(2), pp. 157–172. doi: 10.48204/j.tecno.v8n2.a10864.

Resumen

Este estudio presenta un benchmark textual para comparar nueve modelos comerciales de lenguaje de gran escala en la resolución de problemas de Mecánica Clásica. Se empleó un total de 42 ítems auto-contenidos y sin dependencia explícita de diagramas, extraídos de materiales abiertos de MIT OpenCourseWare correspondientes a 2005 y 2016. Los modelos evaluados pertenecieron a tres proveedores: OpenAI, Anthropic y Google Gemini. Cada problema se presentó mediante un mismo prompt estructurado con respuesta final, resumen breve del razonamiento, ecuaciones, unidades, nivel de confianza. La corrida completa produjo 378 respuestas utilizables. La referencia de corrección se construyó en dos etapas: consenso numérico para 22 ítems y curación manual para 19 casos sin consenso; un ítem permaneció ambiguo por dependencia residual de figuras ausentes. El pipeline alcanzó 100% de éxito final, aunque 29 salidas truncadas requirieron

recuperación a nivel de parser. En acuerdo heurístico con la referencia curada, Gemini obtuvo el mejor rendimiento agregado por proveedor (43.7%; 55/126), mientras que gemini-3.1-pro-preview alcanzó el mejor resultado a nivel de modelo (61.9%; 26/42). Anthropic produjo las respuestas más extensas y lentas, y gemini-3-flash-preview fue el modelo más veloz. Los hallazgos muestran que los LLMs ya apoyan evaluaciones reproducibles en física sin reemplazar expertos.

Descargas

Los datos de descargas todavía no están disponibles.