- Verschifft
- 28. September 2026 um 10:06 UTC
- Autor
- Kamo
- Ausschuss
- c9be36f
HuggingFaceAdapter gestreamt durch die Schnittstelle Text-only-Standard: jeder Brocken war lesen für seinen Text und nichts anderes, so dass keine Verwendung jemals erreichte den Vollstrecker oder Mitglied chat und jede gestreamte Antwort wurde als Chars/4-Schätzung dosiert. Der Strom fragt nun für die Nutzung (stream_options.include_usage, im Chat-Comperling-Spezifikation des Routers) und liest jeden Brocken für seinen Text, finish_reason und die Verwendung. Ein Router, der die Anfrage ablehnt wird ohne ihn erneut vom ParameterFallback des Vollstreckers gefragt; ein Stream ohne Nutzung Brocken bleibt eine Schätzung, als eine gekennzeichnet. Eine Cut-Off-Antwort endet jetzt als max_tokens statt des Lesens als fertig. Der Stream druckt nicht mehr die Anfrage-Einrichtung (die Aufforderung) aus, stdout. SP99-T12.
