Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Mistral AI hat das Open-Source-KI-Modell Leanstral 1.5 unter der Apache-2.0-Lizenz veröffentlicht. Es ist für formale Beweisführung und Code-Verifikation in der Programmiersprache Lean 4 konzipiert. Das Modell erreicht auf dem Benchmark miniF2F eine Erfolgsquote von 100 Prozent und löst 587 von 672 Aufgaben im PutnamBench. Auf den Benchmarks FATE-H und FATE-X erzielt es Bestwerte von 87 beziehungsweise 34 Prozent. In einem Test mit 57 Open-Source-Repositories fand das Modell fünf bisher unbekannte Fehler. Das Training durchlief drei Phasen: Mid-Training, überwachtes Feintuning und bestärkendes Lernen. Das Modell ist über Hugging Face und eine kostenlose API verfügbar. Das Modell hat insgesamt 119 Milliarden Parameter, aber nur 6 Milliarden aktive Parameter. Die Kosten pro PutnamBench-Problem liegen bei etwa vier Dollar, verglichen mit geschätzten 300 Dollar oder mehr für das teurere Seed-Prover 1.5. Die Pipeline zur Fehlersuche in Rust-Code nutzt das Werkzeug Aeneas, das Rust-Code nach Lean übersetzt. Die Pipeline identifizierte 47 verletzte Eigenschaften, von denen sich 11 als echte Bugs herausstellten.