Im Quellenvergleich
Worin die Quellen übereinstimmen
Zwei Forschungsteams haben unabhängig voneinander Frameworks vorgestellt, mit denen KI-Agenten ihre eigene Betriebsumgebung (Harness) automatisch verbessern können. Bisher wurden diese Umgebungen aus Prompts, Tools und Regeln manuell erstellt und blieben statisch. Beide Ansätze ersetzen diesen Prozess durch eine automatisierte Rückkopplungsschleife, in der der Agent eigene Fehler analysiert, Änderungen vorschlägt und testet. Die Frameworks erzielten in Benchmarks Leistungssteigerungen. Als Einschränkungen werden der hohe Ressourcenverbrauch und die Abhängigkeit von leistungsfähigen Modellen genannt. Das Shanghai Artificial Intelligence Laboratory entwickelte Self-Harness, Xiaomi stellte HarnessX vor. Self-Harness steigerte die Leistung auf dem Benchmark Terminal-Bench-2.0 um 33 bis 60 Prozent. HarnessX verbesserte die Leistung in 14 von 15 Modell-Benchmark-Kombinationen um durchschnittlich 14,5 Prozent. HarnessX nutzt eine vierstufige Pipeline (AEGIS), um Probleme wie Belohnungs-Hacking oder das Vergessen bereits gelöster Aufgaben zu verhindern. Eine Besonderheit von HarnessX ist die gemeinsame Optimierung von Harness und Modell (Co-Evolution), bei der die gesammelten Daten als Trainingssignale für das KI-Modell dienen.
Aktualisierungen
06.07.2026
Das Shanghai Artificial Intelligence Laboratory entwickelte Self-Harness, Xiaomi stellte HarnessX vor.
Self-Harness steigerte die Leistung auf dem Benchmark Terminal-Bench-2.0 um 33 bis 60 Prozent.
HarnessX verbesserte die Leistung in 14 von 15 Modell-Benchmark-Kombinationen um durchschnittlich 14,5 Prozent.
HarnessX nutzt eine vierstufige Pipeline (AEGIS), um Probleme wie Belohnungs-Hacking oder das Vergessen bereits gelöster Aufgaben zu verhindern.
Eine Besonderheit von HarnessX ist die gemeinsame Optimierung von Harness und Modell (Co-Evolution), bei der die gesammelten Daten als Trainingssignale für das KI-Modell dienen.
Worin sie sich unterscheidenEntwickler und Leistungssteigerung·Zusätzliche Funktionen und Einschränkungen
Entwickler und LeistungssteigerungSelf-Harness steigerte die Leistung auf dem Benchmark Terminal-Bench-2.0 um 33 bis 60 Prozent. HarnessX verbesserte die Leistung in 14 von 15 Modell-Benchmark-Kombinationen um durchschnittlich 14,5 Prozent.- Besonders kleine Modelle profitierten: Das offene Modell Qwen3.5-9B verbesserte sich bei Planungsaufgaben um 44 Prozent.1
Zusätzliche Funktionen und EinschränkungenSelf-Harness verbraucht viele API-Tokens und Rechenzeit und eignet sich nicht für risikoreiche oder subjektive Bereiche wie medizinische Entscheidungen. HarnessX benötigt ein sehr leistungsfähiges Modell als Meta-Agenten und kann keine grundlegend zu schwachen Modelle verbessern.- Die Rolle des Menschen verschiebt sich bei Self-Harness vom manuellen Anpassen von Prompts hin zum Gestalten der Feedback-Systeme.2
- Die Forscher von HarnessX planen, den Code später zu veröffentlichen.2