Welches LLM baut das beste CAD? Zwölf Modelle in einem Benchmark für parametrische 3D-Teile, bewertet nach Treue, wasserdichten Körpern, Prüfungen und Kosten.
Im veröffentlichten Benchmark für parametrische Teile von OwlCAD liegt GPT-5.6 Sol Pro vorn, mit durchschnittlich 4,3 von 5 Punkten bei der Treue und 99 % seiner Generierungen, die einen wasserdichten Körper ergeben. Danach folgen Grok 4.5 und Gemini 3.6 Flash, wobei Gemini 3.6 Flash das für etwa ein Viertel der Kosten pro Generierung schafft. Die Rangfolge ist ein gewichteter Gesamtwert aus Treue, Wasserdichtheit, Geometrieprüfungen, Kosten und Geschwindigkeit über 12 Benchmark-Läufe.
Beginne mit den absoluten Zahlen. Der Gesamtwert ordnet die Modelle nur untereinander.
Wie genau das Teil der Anfrage entspricht, bewertet von einem blinden Bewerter: 5 heißt richtige Merkmale, Position und Proportionen, druckfertig. Die wichtigste Zahl.
Der Anteil der Generierungen, die im CAD-Kernel einen nicht leeren, wasserdichten Körper ergeben haben. Ein Modell, das gültige Ausgaben, aber keinen Körper liefert, bekommt hier nichts.
Der Anteil der Prompts, deren automatische Erwartungen alle erfüllt wurden, etwa dass Löcher wirklich geschnitten und nicht vorgetäuscht sind oder dass ein Normgenerator genutzt wurde, wo es einen gibt.
Durchschnittliche Anbieterkosten in US-Dollar und durchschnittliche Laufzeit, beides über OpenRouter gemessen: zwischen Modellen vergleichbar, aber nicht identisch mit den Kosten eines direkten Wegs.
Eine gewichtete Mischung aus Treue 45 %, Wasserdichtheit 30 %, Prüfungen 10 %, Kosten 10 % und Geschwindigkeit 5 %, jeweils über die Modelle der Tabelle normiert. Er ordnet dieses Feld; eine absolute Note ist er nicht.
Veröffentlicht am 31. August 2026 · 12 Benchmark-Läufe · 752 Generierungen
KI-Modelle im parametrischen CAD-Benchmark von OwlCAD
Öffne echte Teile der Modelle, die Pro nutzt, im Editor und ohne Konto.
Jedes Modell erhält dieselben Teile-Prompts – Halterungen, Zahnräder, Gehäuse, am Stück gedruckte Mechanismen, Übergänge und Drehkörper – mit demselben Systemprompt, den OwlCAD in Produktion nutzt. Jede Antwort wird validiert, vom Manifold-CAD-Kernel zu einem Körper gebaut, gegen die geometrischen Erwartungen des Prompts geprüft und von einem Bewertungsmodell, das nicht erfährt, welches Modell sie erzeugt hat, mit 1 bis 5 Punkten für die Treue bewertet.
Das wird offengelegt statt verschwiegen. Der Bewerter, Claude Opus 4.8, sieht nie, welches Modell einen Baum erzeugt hat, und die Noten für seine eigenen Generierungen fließen in die Zahlen ein. Die Tabelle zeigt, wie viele seiner Noten Selbstbewertungen waren, damit du sie abziehen kannst, wenn du möchtest.
Pro nutzt Gemini 3.6 Flash, Gemini 3.5 Flash, Claude Opus 4.8 und GPT-5.6 Sol mit deinen monatlichen Credits. Alle anderen Modelle in der Tabelle, darunter GPT-5.6 Sol Pro und Grok 4.5, laufen mit deinem eigenen Anbieter-Schlüssel und verbrauchen keine Credits.
Damit alle Modelle über denselben Transport und dieselbe Preisliste gemessen werden. OwlCAD erreicht manche Modelle in Produktion direkt, daher können echte Kosten und Zeiten von diesen Zahlen abweichen; Treue und Wasserdichtheit hängen nicht vom Weg ab.