Im Quellenvergleich
Worin die Quellen übereinstimmen
TypeSafe hat Jev veröffentlicht, ein Modell, das keinen Text generiert, sondern aus einem Zustand und vorab beschriebenen Fragen je Frage eine typisierte Antwort mit Wahrscheinlichkeitsverteilung liefert. Die Firma wurde von Diogo Almeida gegründet, einem ehemaligen OpenAI-Forscher. Jev kostet laut Anbieter 0,042 US-Dollar pro Million Eingabetoken, die Ausgabe ist kostenlos, die Latenz liegt bei 70–500 ms. Der Kontext umfasst 32K Token. Die Antworten sind auf die vorgegebene Liste beschränkt, woraus TypeSafe „0 % Halluzinationen“ ableitet. TypeSafe nennt selbst Grenzen: keine mehrstufigen Schlussfolgerungen, nur Text, Schulung hauptsächlich auf Englisch, sinkende Genauigkeit bei wachsendem Zustand. Der Zugang erfolgt über eine Warteliste. Die Quellen berichten weitgehend übereinstimmend.
Worin sie sich unterscheidenZeitpunkt und Umfang der Veröffentlichung·Fragetypen·Benchmark-Vergleich+14 weitere
Zeitpunkt und Umfang der Veröffentlichung- TypeSafe stellte Jev am 15. September vor.1
- TypeSafe hat Jev veröffentlicht, ohne ein konkretes Datum zu nennen.1
Fragetypen- Jev kennt drei Fragetypen: Choice (eine Option aus einer Liste), Score (Bewertung auf einer Skala) und Noul (Wahrscheinlichkeit, dass eine Aussage wahr ist).1
Benchmark-Vergleich- In eigenen Vergleichen sei Jev bis zu 193-mal schneller und bis zu 444-mal günstiger als führende LLMs.2
Einschränkungen der Benchmarks- Die Benchmark-Workflows stammen vom TypeSafe-Team.2
- Die nicht subventionierte Preisgestaltung könne der Anbieter laut Nzenga bisher nicht belegen.2
Serverstandort und Latenz- Die Server stehen an der US-Westküste, aus Europa und Russland sind höhere Latenzen zu erwarten.2
Praktischer Test- Ein Test mit einem Ticket ergab nach 72 ms: Abteilung technisch (72 %), Dringlichkeit 99 %, Kundenärger 1 von 2.2
- Beim Nachprüfen von drei in der Dokumentation hinterlegten Beispielantworten stimmten zwei exakt, „Вы бот?“ ergab 0,26 statt der dokumentierten 0,40.2
Reproduzierbarkeit und Kalibrierung- Eine einzelne Stichprobe sagt nichts über Kalibrierung, doch die Reproduzierbarkeit leidet – und Jev baut auf Schwellenwerten auf.2
- Möglicherweise liege es an der Modellversion (aktuell 1.13), von außen prüfbar sei das nicht.2
Kontextgrenzen- TypeSafe nennt 64k Token pro Anfrage, wobei Zustand plus längste Frage 32k nicht überschreiten dürfen.2
Rate Limits- Laut Nzenga gelten 250.000 Token pro Sekunde und 1200 Anfragen pro Minute.2
- Laut Dokumentation vom 7. Oktober gelten 100.000 Token und 80 Anfragen pro Sekunde.2
Sprachliche Eignung- Öffentliche Messungen auf Russisch fand der Autor nicht.2
- Der Autor rät, hundert echte Tickets mit bekannter Markierung zu testen.2
- Die 72 ms belegen keine Qualität auf russischen Tickets.2
Anwendungsnische- Die Nische sei klar: Routing, Moderation, Guardrails für andere LLMs, Annotation großer Textmengen.2
Weitere Umsetzungen derselben Idee- Binnen 16 Tagen folgten fünf weitere Umsetzungen derselben Idee: Clef und Clef-flash von Cloudflare, pplx-decider-v1-27b von Perplexity, Strands Decider 2B von AWS, Laya von Convai Innovations und GLiDE von Fastino.1
Architekturunterschiede- Die Schnittstelle ist nahezu identisch, die Architekturen gehen aber auseinander: eingefrorene LLM mit trainiertem Ausgabekopf, LLM mit ersetztem LM head, Pointer-Mechanismus, Encoder mit 322 Mio. Parametern und bedarfsgesteuertes Reasoning.1
Begründung für Entscheidungsmodellebene- Auf vielen Schritten sei keine Textgenerierung nötig, sondern nur eine Auswahl oder Prüfung.2
Anwendungsfälle- Genannte Anwendungsfälle sind unter anderem die Klassifikation von Befehlen vor der Ausführung, die Modellwahl je nach Anfrage, Agenten-Bewertung und Penetrationstests.1
Einschränkungen der Modelle- Der Artikel weist auf Einschränkungen hin – etwa begrenzte Kontexte, Kalibrierungsprobleme, fehlende Authentifizierung bei Strands Decider und dass jeder Anbieter eigene Tests nutzt.1
Empfehlung- Der Text empfiehlt, Latenz, Kalibrierung und auf die eigene Aufgabe passende Benchmark-Zeilen selbst zu prüfen.1