> ## Documentation Index
> Fetch the complete documentation index at: https://docs.flexinference.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Bekannte Einschränkungen

> Verhalten, das Sie überraschen könnte, und was wir dagegen tun.

Diese Seite listet Verhaltensweisen auf, die Sie überraschen könnten. Wir möchten, dass Sie diese hier lesen, anstatt sie auf einer Rechnung zu entdecken.

## Eine abgebrochene OpenAI-Anfrage kostet die volle Antwort

Brechen Sie eine OpenAI-Anfrage vorzeitig ab, zahlen Sie für die gesamte Antwort. Sie zahlen nicht nur für den Teil, den Sie gelesen haben. Ein vergleichbarer Abbruch bei einem Anthropic- oder Google-Modell stoppt die Abrechnung an der Stelle, an der Sie abgebrochen haben.

Dies gilt, wenn wir Anthropic oder Google selbst aufrufen. Wenn Sie eine Anfrage an Bedrock oder Vertex pinnen, lesen wir sie bis zum Ende, genau wie bei OpenAI.

Der Abbruch beendet Ihre Verbindung sofort, sodass nichts mehr an Ihre Anwendung gestreamt wird. Die Generierung bei OpenAI läuft jedoch weiter, und Sie zahlen dafür. OpenAI bietet uns keine Möglichkeit, eine Streaming-Antwort zu stoppen, und meldet keine Nutzung für eine vorzeitig beendete Antwort, sodass wir Ihnen stattdessen nichts Genaues in Rechnung stellen können. Wir arbeiten an einer Alternative, und diese Seite wird aktualisiert, sobald diese verfügbar ist.

Ihre Logs zeigen eine abgebrochene Anfrage als Canceled an. Die Token-Zahlen entsprechen denen, die der Provider gemeldet hat, bevor Sie die Anfrage gestoppt haben.

Zwei Dinge helfen in der Zwischenzeit. Setzen Sie `max_output_tokens`, damit eine abgebrochene Anfrage eine von Ihnen akzeptierte Länge nicht überschreiten kann. Verwenden Sie Anthropic- oder Google-Modelle, wenn der Abbruch wichtiger ist als die Modellwahl.

## Ein Stream, der teilweise fehlschlägt, beginnt trotzdem mit einem Erfolg

Eine Anfrage kann fehlschlagen, nachdem die Antwort bereits begonnen hat, einzutreffen. Die Statuszeile besagt bereits, dass die Anfrage erfolgreich war, und HTTP bietet keine Möglichkeit, dies rückgängig zu machen.

Der Fehler kommt stattdessen innerhalb des Streams an. Er erscheint als Error-Event, nicht als normales Ende.

Lesen Sie beim Streaming das terminale Event anstelle des Statuscodes. Eine Anfrage, die auf diese Weise fehlgeschlagen ist, markieren wir in Ihren Logs und im Dashboard als failed. Was Sie dort sehen, ist also korrekt.
