¿Qué LLM hace el mejor CAD? Doce modelos en una misma prueba de piezas 3D paramétricas, puntuados en fidelidad, sólidos estancos, comprobaciones y coste.
En la prueba de piezas paramétricas publicada por OwlCAD, GPT-5.6 Sol Pro queda primero, con una fidelidad media de 4,3 sobre 5 y un 99 % de sus generaciones produciendo un sólido estanco. Le siguen Grok 4.5 y Gemini 3.6 Flash, y Gemini 3.6 Flash lo consigue con aproximadamente una cuarta parte del coste por generación. La clasificación es una combinación ponderada de fidelidad, estanqueidad, comprobaciones geométricas, coste y velocidad, a lo largo de 12 ejecuciones de la prueba.
Empieza por las cifras absolutas. La puntuación combinada solo ordena los modelos entre sí.
Lo fielmente que la pieza responde a la petición, según un evaluador ciego: 5 significa las características, la posición y las proporciones correctas, lista para imprimir. La cifra que más importa.
La proporción de generaciones que construyeron un sólido estanco y no vacío en el núcleo CAD. Un modelo que escribe una salida válida pero sin sólido no suma aquí.
La proporción de prompts cuyas expectativas automáticas se cumplieron todas; por ejemplo, que los agujeros estén realmente cortados y no simulados, o que se usara un generador estándar cuando existe.
Coste medio del proveedor en dólares y tiempo medio real, ambos medidos a través de OpenRouter: comparables entre modelos, pero no idénticos a lo que cuesta una ruta directa.
Una mezcla ponderada de fidelidad 45 %, estanqueidad 30 %, comprobaciones 10 %, coste 10 % y velocidad 5 %, cada una normalizada entre los modelos de la tabla. Ordena este grupo; no es una nota absoluta.
Publicado el 31 de agosto de 2026 · 12 ejecuciones · 752 generaciones
Modelos de IA clasificados en la prueba de CAD paramétrico de OwlCAD
Abre piezas reales de los modelos que ejecuta Pro, en el editor y sin cuenta.
Cada modelo recibe el mismo conjunto de prompts de piezas —soportes, engranajes, carcasas, mecanismos impresos en una pieza, transiciones y formas de revolución— con el mismo prompt de sistema que OwlCAD usa en producción. Cada respuesta se valida, el núcleo CAD Manifold la construye como sólido, se comprueba frente a las expectativas geométricas del prompt y un modelo evaluador, al que no se le dice qué modelo la produjo, la puntúa de 1 a 5 en fidelidad.
Se declara en lugar de ocultarse. El evaluador, Claude Opus 4.8, nunca ve qué modelo produjo un árbol, y las notas que dio a sus propias generaciones cuentan en las cifras. La tabla indica cuántas de sus notas fueron autoevaluadas, para que puedas descontarlas si lo prefieres.
Pro ejecuta Gemini 3.6 Flash, Gemini 3.5 Flash, Claude Opus 4.8 y GPT-5.6 Sol con tus créditos mensuales. Todos los demás modelos de la tabla, incluidos GPT-5.6 Sol Pro y Grok 4.5, funcionan con tu propia clave de proveedor y no gastan créditos.
Para medir todos los modelos con un mismo transporte y una misma lista de precios. En producción OwlCAD llega a algunos modelos directamente, así que el coste y el tiempo reales pueden diferir de estas cifras; la fidelidad y la estanqueidad no dependen de la ruta.