Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Laut einer VentureBeat-Umfrage unter 157 Unternehmen klafft eine Lücke zwischen der Autonomie, die Firmen ihren KI-Agenten gewähren, und dem Vertrauen in die Tests, die Fehler verhindern sollen. Die Hälfte der Organisationen hat im vergangenen Jahr einen Agenten ausgeliefert, der die internen Tests bestand, dann aber beim Kunden versagte. Nur fünf Prozent vertrauen der automatisierten Evaluierung vollständig; die häufigste Kritik ist, dass die Tests nicht mit der Realität übereinstimmen. Trotzdem erlauben zwei Drittel der Firmen bereits die vollautomatische Auslieferung ohne menschliche Kontrolle oder arbeiten darauf hin. Die Evaluierungslandschaft ist zersplittert: Die häufigsten primären Werkzeuge sind die nativen Tests der Modellanbieter, gleichauf mit gar keiner speziellen Software (je 17 Prozent). Nur etwa ein Viertel der Unternehmen überwacht die Qualität der Antworten in Echtzeit im Live-Betrieb. Die Autonomie wächst schneller als die Absicherung.