Messung und Abrechnung für KI-Unternehmen: Die Infrastruktur der Token-Abrechnung im Überblick

Abrechnungsinfrastruktur für KI-Unternehmen

KI-Unternehmen sehen sich mit Problemen bei der Verbrauchsmessung und Abrechnung konfrontiert, für die die meisten SaaS-Abrechnungsplattformen nicht ausgelegt sind. Die Preismodelle sind zwar bekannt (nutzungsabhängig, mit gestaffelten Tarifen und Überschreitungsgebühren), die betrieblichen Anforderungen jedoch nicht. Milliarden von Token-Transaktionen pro Monat, die Generierung von Ereignissen im Millisekundenbereich, eine Asymmetrie zwischen Ein- und Ausgabemengen, die sich nicht in eine Tarifstruktur mit einer einzigen Variablen einordnen lässt, sowie Preisgestaltung, die sich mit den sich ändernden Modellfähigkeiten weiterentwickelt. Das sind keine Sonderfälle. Es handelt sich um grundlegende Anforderungen für jedes Unternehmen, das KI kommerzialisiert.

Dieser Artikel richtet sich an Revenue-Engineers und Teams im Abrechnungsbereich von KI-Unternehmen, die nach Wegen suchen, die Token-Nutzung genau zu erfassen, eine Preisgestaltung mit mehreren Variablen ohne benutzerdefinierten Code umzusetzen und die Abrechnungsinfrastruktur im Zuge des Unternehmenswachstums zu skalieren.

Die besonderen Herausforderungen bei der Messung, denen sich KI-Unternehmen gegenübersehen

Ereignisvolumen und -geschwindigkeit

Ein einzelner API-Aufruf an ein großes Sprachmodell erzeugt mindestens zwei abrechnungsrelevante Ereignisse: Eingabe-Token und Ausgabe-Token. Eine Plattform, die 100.000 API-Aufrufe pro Stunde verarbeitet, erzeugt mehr als 200.000 Abrechnungsereignisse pro Stunde. Im großen Maßstab sind das Milliarden von Ereignissen pro Monat – ein Volumen, für dessen Echtzeit-Verarbeitung die meisten SaaS-Abrechnungssysteme nicht ausgelegt sind.

Das Problem des hohen Datenvolumens wird durch Latenz noch verschärft. KI-APIs kommen in Echtzeitanwendungen zum Einsatz, bei denen Kunden erwarten, dass sich ihre Nutzung sofort widerspiegelt. Ein Abrechnungs-Dashboard, das drei Stunden hinter dem tatsächlichen Verbrauch zurückliegt, ist nicht akzeptabel, wenn man Produkte entwickelt, bei denen die API-Kosten eine zentrale betriebliche Kennzahl darstellen. Die Echtzeit-Erfassung bei hohem Datenvolumen erfordert eine Vermittlungsschicht, die auf Durchsatz ausgelegt ist – und keine, die alle paar Stunden eine Stapelverarbeitung durchführt.

Asymmetrie bei der Preisgestaltung von Vorleistungen und Endprodukten

Jede größere KI-API berechnet unterschiedliche Gebühren für Eingabe- und Ausgabetoken. Das Verhältnis zwischen Eingabe- und Ausgabetoken variiert je nach Anwendungsfall erheblich: Eine Zusammenfassungsaufgabe ist ausgabebezogen, eine Klassifizierungsaufgabe ist eingabebezogen, und bei einer Codegenerierungsaufgabe entstehen Ausgabetoken in unvorhersehbaren Anteilen im Verhältnis zur Eingabeaufforderung.

Das bedeutet, dass Sie die Rechnung eines Kunden nicht allein anhand seiner Gesamtzahl an Tokens genau vorhersagen können. Sie benötigen die Aufschlüsselung von Input und Output für jeden API-Aufruf, die separat abgerechnet wird. Ein Abrechnungssystem, das nur eine einvariable Preisgestaltung („Gebühr pro Token“) unterstützt, kann dies nicht korrekt umsetzen. Sie benötigen eine formelbasierte Abrechnung: (Input-Tokens × Rate_in) + (Output-Tokens × Rate_out), die pro Anfrage angewendet wird.

Modellversionierung und differenzierte Preisgestaltung

GPT-4 und GPT-3.5 haben unterschiedliche Tarife. Ein feinabgestimmtes Modell hat andere Tarife als das Basismodell. Ein Batch-Inferenz-Auftrag hat andere Tarife als ein Echtzeit-Inferenz-Aufruf. Jedes KI-Unternehmen mit mehr als einem Modell oder Inferenzmodus muss eine differenzierte Preisgestaltung über eine Matrix aus Modellversion, Inferenztyp und möglicherweise Kundenstufe hinweg verwalten.

In einer Abrechnungsplattform ohne native, formelbasierte und multivariable Tarifgestaltung bedeutet dies in der Regel, dass für jede Kombination aus Modell und Inferenz ein separater Tarifplan erstellt werden muss. Bei zwei oder drei Modellen ist das noch überschaubar. Bei zehn Modellen wird es zu einem Albtraum bei der Pflege, und bei zwanzig Modellen entsteht ein Prüfungsrisiko.

Die Teams, die am Ende die größten Probleme haben, sind diejenigen, die dieses Problem frühzeitig mit technischen Notlösungen gelöst haben: ein Skript, das die Token-Berechnungen durchführt, bevor Daten an das Abrechnungssystem weitergeleitet werden, eine benutzerdefinierte Integration, die Modell-IDs in einer Tabelle den Tarifplänen zuordnet, oder ein manueller Korrekturprozess für die Feinabstimmung der Modellpreise. Diese Lösungen funktionieren bei zwei Modellen und fünfzig Kunden. Bei zehn Modellen und fünfhundert Kunden versagen sie jedoch – meist genau im falschen Moment: während einer Verkaufsoffensive mit neuen Unternehmensverträgen, deren Preisstrukturen die Notlösung nie bewältigen sollte. Die Neugestaltung erfolgt unter Zeitdruck, während bereits Rechnungen im Umlauf sind. Es ist die am leichtesten vermeidbare Form einer Abrechnungskrise.

Preisgestaltung nach Rechenzeit vs. Preisgestaltung nach Token-Anzahl

Bei einigen KI-Abrechnungsmodellen erfolgt die Abrechnung nach Rechenzeit anstelle der Tokenanzahl oder zusätzlich dazu. Einem Kunden, der einen Feinabstimmungsauftrag ausführt, werden GPU-Stunden in Rechnung gestellt, nicht Token. Einem Kunden, der ein Bildverarbeitungsmodell nutzt, werden möglicherweise pro analysiertem Bild Kosten berechnet, während einem Kunden, der ein Textmodell nutzt, die Kosten pro Token in Rechnung gestellt werden. Die Messebene muss mehrere Metriktypen pro Kunde verfolgen – möglicherweise gleichzeitig – und jeden einzelnen dem richtigen Abrechnungsmodell zuordnen.

Anforderungen an die Rating-Engine

Unterstützung für Formeln mit mehreren Variablen

Unverzichtbar für die Preisgestaltung im KI-Bereich. Die Bewertungs-Engine muss Ausdrücke der Form (input_tokens × rate_in) + (output_tokens × rate_out) unterstützen, wobei beide Eingabegrößen separat gemessen werden und beide Tarife ohne Programmieraufwand konfigurierbar sind. Wenn für die Implementierung einer neuen Preisstufe für ein Modell ein Support-Ticket erforderlich ist, ist die Abrechnungsplattform nicht auf die tatsächlichen Abläufe der KI-Preisgestaltung ausgelegt.

Ein Praxistest: Kann Ihre Abrechnungsplattform die folgenden Einstellungen in weniger als 10 Minuten über eine Benutzeroberfläche konfigurieren, ohne dass Techniker hinzugezogen werden müssen? GPT-4o-Preise: 2,50 US-Dollar pro Million Eingabe-Token, 10,00 US-Dollar pro Million Ausgabe-Token, 1,25 US-Dollar pro Million zwischengespeicherte Eingabe-Token. Das sind drei Variablen und drei Tarife für ein einzelnes Modell. Multiplizieren Sie das mit Ihrem Modellkatalog.

Echtzeit-Tarifberechnung mit für den Kunden sichtbarer Nutzung

KI-Entwickler überwachen ihren Token-Verbrauch aktiv. Sie integrieren Kostenbegrenzungen in ihre Anwendungen. Sie richten Budgetwarnungen ein. Damit dies funktioniert, müssen den Kunden die ausgewerteten Nutzungsdaten nahezu in Echtzeit zur Verfügung stehen (innerhalb weniger Minuten nach dem API-Aufruf, nicht erst am nächsten Tag).

Die Anforderung ist eine Echtzeit-Nutzungsabrechnung (nicht nur die reine Anzahl der Ereignisse). Kunden möchten nicht sehen, dass sie 1,4 Millionen API-Aufrufe getätigt haben. Sie möchten sehen, dass sie 47 Dollar von einem Budget von 100 Dollar ausgegeben haben. Dazu muss die Abrechnungs-Engine Ereignisse kontinuierlich verarbeiten und nicht in nächtlichen Batches.

Verwaltung von Überziehungsbeträgen und Guthaben

Viele KI-APIs bieten neben der nutzungsabhängigen Abrechnung auch Prepaid-Guthaben an. Ein Kunde erwirbt Guthaben im Wert von 500 US-Dollar, das bei der Nutzung der API abgezogen wird; sobald das Guthaben aufgebraucht ist, wird die Nutzung zu Überziehungssätzen abgerechnet (oder gesperrt). Das Abrechnungssystem muss die Guthabenstände in Echtzeit verfolgen, den Verbrauch vor der Abrechnung mit dem Guthaben verrechnen und Schwellenwertwarnungen auslösen, wenn die Guthaben unter festgelegte Werte fallen.

Hierbei handelt es sich um ein Hybridmodell: Prepaid + nutzungsabhängige Abrechnung + Überziehungsgebühren – alles auf einem einzigen Konto, möglicherweise für mehrere Modelle gleichzeitig. Dies ist eine gängige Struktur zur Monetarisierung von KI und ein aufschlussreicher Test für die Reife einer Plattform. Gerade in den Randfällen scheitern die meisten Abrechnungsplattformen. Das Guthaben eines Kunden wird mitten im Abrechnungszeitraum negativ, wenn ein großer Batch-Job abgeschlossen wird, nachdem sein Guthaben aufgebraucht ist. Die meisten Plattformen erkennen dies erst bei der Abrechnung, nicht in Echtzeit, sodass dem Kunden eine Mehrkostengebühr in Rechnung gestellt wird, die er nicht erwartet und nicht genehmigt hat. Guthaben verfallen am Ende des Abrechnungszeitraums ungenutzt, ohne dass eine automatische Benachrichtigung erfolgt, was zu überraschenden Rückbuchungen und Streitfällen führt. Ein Kunde kauft während des Abrechnungszeitraums zusätzliches Guthaben, und der neue Kontostand wird nicht sofort auf die laufende Nutzung angerechnet, sodass Überziehungsgebühren für die Nutzung anfallen, die eigentlich durch das Guthaben hätte abgedeckt werden sollen. In jedem dieser Fälle muss das Abrechnungssystem den Guthabenstatus kontinuierlich verfolgen und darf sich nicht auf einen nächtlichen Batch-Lauf beschränken. Bitten Sie die Anbieter, Ihnen jedes Szenario in einer Demo zu demonstrieren.

Hybride Abonnement- und Nutzungsmodelle

Kunden von Enterprise-KI-Lösungen nutzen häufig ein Hybridmodell: ein Basisabonnement (mit monatlicher oder jährlicher Laufzeit), das ein Nutzungskontingent umfasst, sowie Gebühren für die Nutzung, die über das inbegriffene Kontingent hinausgeht. Das Abrechnungssystem muss die Nutzung korrekt gegen das inbegriffene Kontingent abgleichen und die Gebühren für die Überschreitung nur auf die Nutzung anwenden, die über den Schwellenwert hinausgeht.

Wenn der Kunde seinen Vertrag während der Laufzeit verlängert oder ein Upgrade durchführt (und dabei sein Inklusivkontingent oder seinen Überziehungssatz ändert), muss das System die alten Konditionen auf die Nutzung vor der Änderung und die neuen Konditionen auf die Nutzung nach der Änderung anwenden. Die periodengeteilte Abrechnung ist für KI-Unternehmen ebenso entscheidend wie für jedes andere SaaS-Unternehmen.

Infrastrukturanforderungen im KI-Maßstab

Mediation bei Ereignissen mit hoher Häufigkeit

Angesichts des hohen Volumens an Ereignissen, das KI-Plattformen erzeugen, wird die Vermittlungsinfrastruktur zu einer kritischen Pfadabhängigkeit. Die Vermittlungsschicht muss die persistente Ereignispufferung gewährleisten (Ereignisse werden vor der Verarbeitung dauerhaft gespeichert, sodass bei Lastspitzen keine Verluste entstehen), die Idempotenz bei hohem Durchsatz sicherstellen (Erkennung von Duplikaten ohne Beeinträchtigung der Erfassungsgeschwindigkeit) und die nachträgliche Ereignisverarbeitung für Batch-Inferenzjobs ermöglichen, bei denen Abschlussereignisse erst deutlich nach Beginn der Inferenz eintreffen können.

Unveränderliches Ereignisprotokoll

KI-Unternehmen sehen sich häufig mit Fragen zur Nutzungsgenauigkeit konfrontiert – sei es von Kunden, von Investoren, die die Unit Economics prüfen, oder von Wirtschaftsprüfern, die die Umsatzkosten untersuchen. Ein unveränderliches Ereignisprotokoll (eine dauerhafte, manipulationssichere Aufzeichnung jedes Token-Ereignisses zum Zeitpunkt seines Eintreffens) bildet die Grundlage dafür, all diese Fragen eindeutig zu beantworten. Ohne dieses Protokoll wird ein Abrechnungsstreit zu einer Diskussion nach dem Motto „dein Wort gegen meines“. Mit diesem Protokoll ist es eine einfache Überprüfung.

Überlegungen zu ASC 606

KI-Unternehmen mit Unternehmensverträgen, die nutzungsabhängige Komponenten enthalten, müssen variable Umsätze gemäß ASC 606 erfassen. Dies setzt voraus, dass die Messdaten genau, mit einem Zeitstempel versehen und überprüfbar sind. Die Rechtfertigung Ihrer Umsatzrealisierung hängt vollständig von der Zuverlässigkeit Ihrer Ereignisdaten ab. Ein KI-Unternehmen, das seine erfassten Umsätze nicht auf die Token-Ereignisse zurückführen kann, die diese generiert haben, ist einem Risiko in der Finanzberichterstattung ausgesetzt – es handelt sich nicht nur um ein Abrechnungsproblem.

Worauf Sie bei der Bewertung einer Abrechnungsplattform achten sollten

Wenn Sie Abrechnungsplattformen für die Monetarisierung von KI bewerten, sollten Sie folgende Punkte in Ihre Bewertungscheckliste aufnehmen:

  • Lässt sich die Preisgestaltung anhand mehrerer Variablen (Eingabe- und Ausgabetoken, unterschiedliche Sätze) ohne Programmierung konfigurieren?
  • Nutzungsdaten in Echtzeit – für Kunden innerhalb weniger Minuten nach dem API-Aufruf sichtbar, und zwar als Abrechnungsbeträge und nicht als reine Ereigniszahlen.
  • Kann das System die Inanspruchnahme von Prepaid-Guthaben in Echtzeit zusammen mit nutzungsabhängigen Mehrkosten verwalten?
  • Vertragsänderungen während der Laufzeit: Erfolgt die periodengeteilte Bewertung automatisch oder ist ein manueller Eingriff erforderlich?
  • Wie hoch ist der Durchsatz bei der Ereignis-Erfassung unter Spitzenauslastung? Führen Sie einen Benchmark-Test durch.
  • Ein unveränderliches Ereignisprotokoll vom Rohdatensatz bis zur Rechnungszeile – bitten Sie sie, es Ihnen live vorzuführen.
  • ASC 606 / IFRS 15: Integriert oder als separates Modul? Die Antwort auf diese Frage bestimmt, wer verantwortlich ist, wenn es zu Abweichungen zwischen erfassten Umsatzerlösen und Rechnungsstellung kommt.

Die Frage nach der Abrechnungsinfrastruktur wird von den meisten KI-Unternehmen erst dann als Priorität angesehen, wenn sie bereits über ihre ursprüngliche Lösung hinausgewachsen sind. Der Abrechnungsstack, der für Ihre ersten 100 Unternehmenskunden funktioniert, ist möglicherweise für Ihren 500. Kunden nicht mehr geeignet. Ihn unter Zeitdruck neu aufzubauen, während bereits laufende Kundenrechnungen zu bearbeiten sind, ist eine deutlich schlechtere Erfahrung, als ihn gleich von Anfang an richtig aufzubauen.

Häufig gestellte Fragen

Welche Abrechnungsinfrastruktur benötigen KI-Unternehmen, die die Standard-SaaS-Abrechnung nicht bietet?

Drei Funktionen, die über die Standard-SaaS-Abrechnung hinausgehen: formelbasierte Tarifierung für die Preisgestaltung mit mehreren Variablen (Eingabe- und Ausgabetoken zu unterschiedlichen Tarifen, pro Modell, ohne Programmieraufwand konfigurierbar); für Kunden innerhalb weniger Minuten nach einem API-Aufruf sichtbare, in Echtzeit berechnete Nutzungsdaten, die als Abrechnungsbeträge statt als reine Ereigniszahlen dargestellt werden; sowie die Verwaltung von Prepaid-Guthaben – Verfolgung der Guthabeninanspruchnahme in Echtzeit, Anrechnung von Guthaben vor der Abrechnung von Überziehungsgebühren sowie Generierung von Schwellenwertwarnungen. Die Standard-SaaS-Abrechnung umfasst Abonnements sowie die Abrechnung von Mehrverbrauch. Keine dieser drei Funktionen gehört zum Standardumfang.

Wie funktioniert die tokenbasierte Abrechnung bei KI-APIs?

Bei der tokenbasierten Abrechnung werden die Eingabetoken (an das Modell gesendeter Text) und die Ausgabetoken (generierter Text) für jeden API-Aufruf gezählt und jeweils mit separaten Tarifen verrechnet. Die Formel lautet: (Eingabetoken × Eingabetarif) + (Ausgabetoken × Ausgabetarif). Die Tarife variieren je nach Modell und – bei Unternehmenskunden – je nach Vertragsstufe oder ausgehandeltem Rabatt. Das Abrechnungssystem muss sowohl die Token-Anzahlen pro Aufruf erfassen, den für das Modell und den Kunden zutreffenden Tarifplan anwenden und die Daten über Abrechnungszeiträume hinweg aggregieren – und gleichzeitig den Kunden, die ihre Budgets verwalten, den Verbrauch in Echtzeit anzeigen.

Welche Sonderfälle bei der Abrechnung von Prepaid-Guthaben werden von den meisten Plattformen nur unzureichend behandelt?

Die häufigsten Fehlerquellen: Das Guthaben eines Kunden wird mitten im Abrechnungszeitraum negativ, wenn ein umfangreicher Batch-Job abgeschlossen wird, nachdem das Guthaben aufgebraucht ist. Die meisten Plattformen erkennen dies erst bei der Abrechnung, nicht in Echtzeit. Guthaben verfallen am Ende des Abrechnungszeitraums ungenutzt, ohne dass eine automatische Benachrichtigung erfolgt, was zu überraschenden Stornierungen und Kundenreklamationen führt. Ein Kunde kauft während des Abrechnungszeitraums zusätzliches Guthaben, doch der neue Kontostand wird nicht sofort auf die laufende Nutzung angerechnet, sodass Überziehungsgebühren für die Nutzung anfallen, die eigentlich durch das Guthaben hätte abgedeckt werden sollen. In jedem dieser Fälle muss das Abrechnungssystem den Guthabenstatus in Echtzeit und nicht im Batch-Verfahren verfolgen.

Welche Auswirkungen hat ASC 606 auf KI-Unternehmen mit nutzungsabhängiger Preisgestaltung?

Gemäß ASC 606 müssen variable Gegenleistungen (einschließlich nutzungsabhängiger Umsätze) geschätzt und in den Transaktionspreis einbezogen werden, sofern es wahrscheinlich ist, dass der Betrag nicht rückgängig gemacht wird. Dies erfordert Messdaten, die genau, mit einem Zeitstempel versehen und überprüfbar sind. Ein KI-Unternehmen, das seine erfassten Umsätze nicht auf die zugrunde liegenden Token-Ereignisse zurückverfolgen kann, geht ein Risiko in der Finanzberichterstattung ein: Wenn Ihre Umsatzrealisierungsposition bei einer Prüfung angefochten wird, ist das Ereignisprotokoll die einzige Verteidigungsmöglichkeit. KI-Unternehmen mit Unternehmensverträgen sollten sicherstellen, dass ihre Abrechnungsplattform ein unveränderliches Ereignisprotokoll erstellt, das jeden erfassten Dollar mit spezifischen Nutzungsdaten verknüpft.

Warum ist die Echtzeit-Nutzungsauswertung für Kunden von KI-APIs wichtig?

KI-Entwickler bauen Kostenbegrenzungen in ihre Anwendungen ein: Budgetwarnungen, Ratenbegrenzungen, Ausgabenobergrenzen. Damit diese Kontrollen funktionieren, müssen Kunden ihren Verbrauch nahezu in Echtzeit als in Rechnung gestellte Beträge sehen und nicht erst am nächsten Tag als reine Ereigniszahlen. Ein Kunde mit einem Tagesbudget von 100 Dollar muss nach seinen morgendlichen API-Aufrufen „47 Dollar ausgegeben“ sehen, nicht „1,4 Millionen verbrauchte Tokens“. Dazu muss die Abrechnungs-Engine Ereignisse kontinuierlich verarbeiten – nicht in nächtlichen Batches – und den Kunden die kostenpflichtige Nutzung in Echtzeit anzeigen. Plattformen, die dazu nicht in der Lage sind, verursachen eine unverhältnismäßig hohe Belastung des Kundensupports – ein bekannter Grund für Kundenabwanderung im KI-API-Geschäft.

Den vollständigen Leitfaden für Fachleute zum Thema Messung und Einstufung finden Sie unter billingplatform.com/metering-and-rating.

Siehe auch: Formelnbasierte Preisgestaltung: Wenn die Abfrage von Preisstufen nicht ausreicht | So funktionieren Rating-Engines: Ein technischer Leitfaden | Was führt zu Umsatzverlusten – und wie lassen sie sich vermeiden? | Duplikatsbereinigung bei der Abrechnung | Was ist Abrechnungsmediation?

Beitrag teilen: