Try our cookies Alza.cz a. s., Company identification number 27082440, use cookies and other data to ensure the proper functioning of the website and, with your consent, also, among other things, to personalize advertising and the content of our websites. By clicking on the “I understand“ button, you agree to the use of cookies and the transfer of data regarding the behavior on the website for displaying targeted advertising on social networks and advertising networks on other websites.
Alzak icon

Wie viele Nutzer schafft ein KI-Server? Leistung auf dem Papier kann täuschen und Fehler sind teuer

• Autor: Peter Vnuk

Wissen Sie, warum sich die Leistung eines KI-Servers nicht nur anhand der GPU im Datenblatt beurteilen lässt, wie Sie Token auf reale Nutzer umrechnen und woran Sie erkennen, ob die Infrastruktur Ihren neuen Chatbot, RAG oder interne KI-Assistenten im Unternehmensbetrieb bewältigen kann?

KI-Server und Kapazität

Wie viele Nutzer schafft ein KI-Server – INHALT

  1. Die Leistung eines KI-Servers berechnet sich nicht nur aus Parametern
  2. Warum eine einzige Antwort nicht ausreicht
  3. Wie viele Nutzer bedeutet eigentlich wie viel?
  4. Das Datenblatt hilft, berechnet die Kapazität aber nicht für Sie
  5. Grundlegende Berechnung: Wie viele Token verbraucht ein Nutzer
  6. Das Modell entscheidet mehr als der Name des Servers
  7. RAG: Wenn der Chatbot nicht rät, sondern in Unternehmensdokumenten sucht
  8. Ein Server kann ausreichen, wenn Sie wissen, was Sie von ihm erwarten
  9. Wie Sie einen Benchmark beauftragen, der geschäftlichen Wert hat

Die Leistung eines KI-Servers berechnet sich nicht nur aus Parametern

Die Leistung eines KI-Servers wirkt auf den ersten Blick wie eine Disziplin, die sich mit einem Blick in die technischen Daten klären lässt. Ein Unternehmen vergleicht die Anzahl der GPUs, die Speichergröße sowie die TFLOPS-Werte im Datenblatt und gewinnt schnell das Gefühl, damit die Grundkapazität berechnet zu haben. Doch bei generativer künstlicher Intelligenz entstehen genau an diesem Punkt oft die teuersten Fehler, da die reine Hardware noch nichts darüber aussagt, wie viele Personen den Dienst komfortabel nutzen können, wie viele warten müssen und wann das System an die Grenze einer akzeptablen Reaktionszeit stößt.

Bei einem KI-Server kommt es darauf an, welches KI-Modell darauf läuft, wie lang die Anfragen und wie umfangreich die Antworten sein werden, wie schnell der Text auf dem Bildschirm erscheinen soll und wie viele Anfragen im selben Moment eingehen. Derselbe Server kann daher für einen einfachen internen Assistenten deutlich überdimensioniert sein, während er bei der Arbeit mit langen Verträgen, technischer Dokumentation oder einem größeren Modell viel früher an seine Grenzen stößt.

KI-Server und Kapazität

Warum eine einzige Antwort nicht ausreicht

Ein Wert aus dem Datenblatt ist ein nützlicher Einstieg in die technische Diskussion, reicht für sich allein jedoch nicht aus, um die Frage zu beantworten, wie viele Nutzer ein Server tatsächlich bewältigen kann. Bei einer herkömmlichen Webanwendung wird die Leistung häufig in Anfragen pro Sekunde umgerechnet, da der Server eine Anfrage verarbeitet, das Ergebnis zurückgibt und sich der nächsten Anfrage widmen kann. Bei einem Chatbot ist die Situation komplexer, da das Modell die Antwort schrittweise generiert und über den gesamten Zeitraum hinweg einen Teil der Leistung beansprucht.

Zudem belastet ein einzelner Nutzer den Server nicht über die gesamte Dauer seiner Anmeldung: Er tippt eine Weile an seiner Frage, wartet dann auf die ersten Worte der Antwort, liest anschließend das Ergebnis und stellt erst danach die nächste Anfrage. Kurze interne Abfragen, eine einfache Dokumentenklassifizierung und ein juristischer Assistent, der mit langen Texten arbeitet, sind daher drei völlig unterschiedliche Szenarien. In einer Präsentation fallen sie möglicherweise alle unter Unternehmens-KI, aus Sicht der Infrastruktur bedeuten sie jedoch völlig verschiedene Anforderungen an Speicher, Latenz, Durchsatz sowie Puffer für Lastspitzen. Genau deshalb ist es nicht zielführend, nur nach der Leistungsfähigkeit des Servers zu fragen, sondern vor allem danach, welche konkrete Aufgabe er erfüllen soll.

KI-Server

Wie viele Nutzer bedeutet eigentlich wie viel?

Das erste Problem entsteht bereits beim Begriff des Nutzers selbst. Ein Unternehmen kann 10.000 Mitarbeiter haben, das bedeutet jedoch nicht, dass der KI-Server gleichzeitig 10.000 Antworten generieren muss. Zu einem bestimmten Zeitpunkt wird die Mehrheit der Personen die Anwendung gar nicht geöffnet haben, ein Teil liest die fertige Ausgabe und nur eine kleinere Gruppe wartet gerade darauf, dass das Modell den nächsten Teil der Antwort generiert.

Für die Kapazitätsplanung ist daher die Anzahl der gleichzeitig bedienten Anfragen wichtiger als die Gesamtzahl der Personen mit Zugriff auf den Dienst. Bei einem generativen Chatbot ist es noch präziser, die Anzahl der Antworten zu beobachten, die das Modell im selben Augenblick aktiv generiert. Wenn zwanzig Personen das Ergebnis lesen und fünf Personen im selben Moment eine neue Antwort erhalten, stellen genau diese fünf laufenden Generierungsprozesse die größte Last für die GPU dar.

Formulierungen wie „der Server schafft 500 Nutzer“ sind daher nur dann aussagekräftig, wenn klar definiert ist, um welche Art von Nutzern es sich handelt. Es kann sich um angemeldete Konten, aktive Sessions, gleichzeitige Anfragen oder zeitgleich generierte Antworten handeln. Für die Kaufentscheidung ist die letzte Option am praktischsten, da genau sie mit Generierungsgeschwindigkeit, Latenz und dem tatsächlichen Nutzererlebnis verknüpft werden kann.

i

Agner Krarup Erlang formalisierte das Problem der Parallelität für Telefonzentralen bereits im Jahr 1909. Von den registrierten Teilnehmern waren zu Spitzenzeiten lediglich 5–15 % aktiv. Bei KI-Diensten gilt dieselbe Logik: Von tausend Mitarbeitern mit Zugang zum Chatbot warten zu Spitzenzeiten nur wenige Dutzend auf eine Antwort. Der Schlüssel zur richtigen Kapazität liegt in der Dimensionierung nach Gleichzeitigkeit, nicht nach der Gesamtzahl der Nutzer.

Wo künstliche Intelligenz läuft

Das Datenblatt hilft, berechnet die Kapazität aber nicht für Sie

Die GPU-Parameter haben beim Entwurf eines KI-Servers einen klaren Wert. Die Rechenleistung zeigt, wie leistungsfähig der verwendete Chip ist, die VRAM-Kapazität bestimmt, wie groß das Modell und der Kontext sein dürfen, die in den Speicher passen, die Speicherbandbreite beeinflusst die Generierungsgeschwindigkeit und der Interconnect entscheidet darüber, wie effizient mehrere GPUs zusammenarbeiten. Das Problem entsteht in dem Moment, in dem diese Angaben zum einzigen Kaufkriterium erhoben werden und die restliche betriebliche Realität unberücksichtigt bleibt.

Bei Sprachmodellen entscheidet sich die Leistung in der Praxis an Metriken, die näher am tatsächlichen Anwendungsverhalten liegen. Die Latenz gibt an, wie lange der Nutzer wartet, der Throughput zeigt, wie viel Arbeit das System insgesamt bewältigen kann, und Tokens/s beschreiben, wie schnell das Modell Ausgaben generiert. Wichtig ist auch die TTFT (Time to First Token), da die Zeit bis zum ersten sichtbaren Teil der Antwort oft darüber entscheidet, ob eine Anwendung als schnell oder träge wahrgenommen wird.

Metrik Was sie anzeigt Wie sie in der Praxis zu verstehen ist
VRAM Speicherkapazität der GPU Entscheidet darüber, wie groß das Modell, der Kontext und die Anzahl der Sessions sein können, die in den Speicher passen
Tokens/s Geschwindigkeit der Textgenerierung Grundlegende Metrik zur Umrechnung auf gleichzeitig bediente Nutzer
TTFT Zeit bis zum ersten Token Beeinflusst den ersten Eindruck hinsichtlich der Reaktionsschnelligkeit der Anwendung
Latenz p95/p99 Antwortzeit der Mehrheit sowie der langsamsten Anfragen Zeigt, ob das System die Qualität auch bei Lastspitzen aufrechterhält
Throughput Gesamtdurchsatz des Dienstes Hilft bei der Kapazitätsplanung für eine größere Anzahl von Anfragen
Kontextlänge Wie viel Text das Modell im Speicher hält Erhöht bei langen Dokumenten rasch den VRAM-Bedarf

Der beste Wert aus einem Benchmark ist oft weniger wichtig als die Bedingungen, unter denen er erzielt wurde. Ein Test mit kurzem Prompt, kurzer Antwort und idealem Batching kann hervorragend aussehen, sagt aber über einen Unternehmensassistenten mit umfangreichen Dokumenten, deutscher Sprache und morgendlichen Lastspitzen nur wenig aus. Entscheidend ist daher, die Leistung bei vergleichbarer Anfragelänge, vergleichbarer Antwortlänge und einer ähnlichen Gleichzeitigkeit zu testen, wie sie der künftige Produktivbetrieb aufweisen wird.

Entwicklung und Betrieb von künstlicher Intelligenz

Grundlegende Berechnung: Wie viele Token verbraucht ein Nutzer

Bei generativer KI lässt sich mit einem einfachen Kapazitätsmodell beginnen. Schafft ein Server beispielsweise 6.000 Ausgabetoken pro Sekunde und möchte ein Unternehmen, dass ein aktuell bedienter Nutzer die Antwort mit einer Geschwindigkeit von 15 Token pro Sekunde erhält, ergibt sich eine rechnerische Bruttokapazität von 400 gleichzeitig generierten Antworten. Im Produktivbetrieb muss von dieser Zahl ein Puffer für Lastspitzen, längere Anfragen, Kontextverarbeitung, ungleichmäßiges Nutzerverhalten und den allgemeinen Overhead der Anwendung abgezogen werden.

Eine solche Berechnung ist keine exakte Prognose des realen Betriebs, aber ein sehr guter Entscheidungsfilter. Sie zeigt schnell, ob das Unternehmen über einen Server für ein Pilotprojekt, einen internen Assistenten für ein kleineres Team oder über eine Infrastruktur für hunderte Personen zur Spitzenzeit spricht. Gleichzeitig zwingt sie den Auftraggeber dazu zu definieren, welche Antwortgeschwindigkeit für den jeweiligen Dienst noch komfortabel ist und welche bereits als Arbeitsbremse wahrgenommen wird.

Wichtig ist auch der Betriebspuffer, da ein Produktivsystem nicht so ausgelegt sein darf, dass es während normaler Lastspitzen dauerhaft an der Belastungsgrenze läuft. Es genügt ein längeres Dokument, eine komplexere Anfrage, eine langsamere Komponente der Anwendungsschicht oder ein Wartungseingriff, und die Reaktionszeit beginnt sich rapide zu verschlechtern. Ein Puffer ist daher kein Luxus, sondern eine Absicherung dafür, dass der Dienst auch abseits idealer Bedingungen nutzbar bleibt.

Frage Praktische Auswirkung
Wie viele Token umfasst eine typische Antwort? Eine längere Antwort belegt die GPU über einen längeren Zeitraum
Wie viele Token pro Sekunde soll ein Nutzer erhalten? Höherer Komfort verringert die Anzahl gleichzeitiger Antworten
Wie lang wird der Eingabekontext sein? Ein längerer Prompt erhöht den Speicherbedarf und verlangsamt die Verarbeitung
Wie viele Personen nutzen den Dienst zu Spitzenzeiten? Die Gesamtzahl der Mitarbeiter ist weniger wichtig als die Gleichzeitigkeit
Wie groß sollte der Puffer sein? Ein Produktivsystem darf nicht für eine dauerhafte Auslastung von 100 % ausgelegt sein

Bei nicht-generativen Aufgaben wird die Kapazität anders berechnet. Klassifizierung, Embeddings oder einfache Suchvorgänge lassen sich häufig über Anfragen pro Sekunde ausdrücken, da die Antwort nicht durch schrittweises Generieren von langem Text entsteht. Wenn ein Dienst 2.000 Anfragen pro Sekunde verarbeiten kann und ein aktiver Nutzer durchschnittlich eine Anfrage alle zehn Sekunden sendet, fällt das Kapazitätsmodell völlig anders aus als bei einem Chatbot, der eine lange Antwort Token für Token generiert.

Das Modell entscheidet mehr als der Name des Servers

Die Modellgröße verändert die Anforderungen an die Infrastruktur drastisch. Kleinere Modelle mit bis zu etwa 10 Milliarden Parametern können bei guter Optimierung eine sehr beachtliche Anzahl interner Anfragen bedienen – insbesondere dann, wenn das Unternehmen keinen extrem langen Kontext benötigt. Größere Modelle bieten zwar bei anspruchsvolleren Aufgaben eine höhere Antwortqualität, steigern jedoch gleichzeitig die Anforderungen an VRAM, Speicherbandbreite und den effizienten Betrieb über mehrere GPUs hinweg erheblich.

Die reinen Modellparameter sind dabei nur der erste Teil der Speichergleichung. In den Speicher muss auch der KV-Cache passen, also der Zwischenspeicher des Modells für bereits verarbeitete Token. Weiteren Platz beanspruchen die Inference Engine und die Batch-Verarbeitung von Anfragen. Wenn der Server mehrere Modelle gleichzeitig bedient, muss zudem für jedes Modell eine separate Speicherreserve einkalkuliert werden.

Eine Quantisierung kann den Ressourcenbedarf senken, sollte jedoch an der konkreten Aufgabe und nicht nur anhand eines allgemeinen Benchmarks überprüft werden. Bei einem internen Assistenten, der wiederkehrende betriebliche Fragen beantwortet, kann eine sparsamere Konfiguration ein sinnvoller Kompromiss sein. Bei juristischen, technischen oder finanziellen Ausgaben muss hingegen geprüft werden, ob die gewählte Genauigkeit nicht die Arbeit mit Details beeinträchtigt – beispielsweise, ob das Modell ähnliche Vertragsklauseln schlechter unterscheidet, kleine Unterschiede in technischen Spezifikationen übersieht oder Zahlenangaben auf eine Weise vereinfacht, die in einem kurzen Labortest möglicherweise nicht auffällt.

i

Der KV-Cache (Key-Value-Cache) speichert Zwischenberechnungen für jedes Token im Kontext – und zwar separat für jede laufende Session. Bei einer Kontextlänge von 32.000 Token belegt er etwa viermal so viel VRAM wie bei einem Kontext von 8.000 Token. Bei 50 gleichzeitigen Sitzungen vervielfacht sich dieser Unterschied um das Fünfzigfache. Größere Modelle mit längerem Kontext stoßen daher nicht nur an Grenzen der Rechenleistung, sondern vor allem an die des Speichervolumens – genau aus diesem Grund skaliert die Kapazität bei RAG-Assistenten, die mit langen Dokumenten arbeiten, völlig anders als bei Assistenten für kurze Abfragen.

Entwicklung und Betrieb von künstlicher Intelligenz

RAG: Wenn der Chatbot nicht rät, sondern in Unternehmensdokumenten sucht

Ein unternehmensinterner KI-Assistent soll oft nicht nur aus dem allgemeinen Wissen des Modells heraus antworten. Viel nützlicher ist es, wenn er vor der Antwort relevante Informationen in internen Dokumenten, Handbüchern, Verträgen oder Wissensdatenbanken sucht. Dies nennt man RAG bzw. Retrieval-Augmented Generation. Einfach ausgedrückt handelt es sich um eine Kombination aus Recherche und Generierung: Das System findet zunächst die Unterlagen und erst danach stellt das Modell daraus die Antwort zusammen.

Für ein Unternehmen bedeutet das einen entscheidenden Unterschied. Das Modell muss nicht alles „im Kopf“ haben – also in den trainierten Parametern gespeichert –, sondern kann mit aktuellen Daten arbeiten, die sich im Unternehmen fortlaufend ändern. So kann der Chatbot auf Basis der neuesten Version einer internen Richtlinie, der Produktdokumentation oder der Geschäftsbedingungen antworten und nicht nur anhand dessen, was das Modell während des Trainings gelernt hat.

Aus Leistungssicht kommt jedoch zusätzliche Arbeit hinzu, die das System vor der eigentlichen Antwort bewältigen muss. Zunächst muss die Anfrage in ein suchfähiges Format umgewandelt werden, relevante Abschnitte müssen gefunden, mitunter nochmals nach Relevanz neu geordnet werden (sogenanntes Reranking) und schließlich in den Prompt für das Sprachmodell eingefügt werden. Erst danach beginnt die eigentliche Generierung der Antwort.

Entwicklung und Betrieb von künstlicher Intelligenz

Aus diesem Grund kann ein RAG-Assistent langsamer und ressourcenintensiver sein als ein einfacher Chatbot ohne Dokumentenanbindung. Die Kapazität wird nicht allein durch die Generierungsgeschwindigkeit von Token bestimmt, sondern auch durch Suchvorgänge, Datenbanken, den Umgang mit längerem Kontext, die Dokumentenqualität sowie die Anwendungsschicht um das Modell herum. Hier zeigt sich oft der Unterschied zwischen einer ansprechenden Demo und einem Werkzeug, das im Arbeitsalltag eingesetzt werden kann. Eine Demo arbeitet möglicherweise mit wenigen vorbereiteten Fragen und kurzen Dokumenten. Der Produktivbetrieb bringt jedoch lange Dateien und unpräzise Anfragen mit sich, die das System korrekt verstehen muss. Hinzu kommen unterschiedliche Dokumentenversionen und mehrere Personen, die den Assistenten zur selben Zeit nutzen.

Eine Demo kann daher ein guter Anfang sein, sollte jedoch nicht der letzte Schritt vor der Anschaffung eines Servers sein. In der Praxis ist es sinnvoll, vom Anbieter oder dem internen IT-Team eine praktische Überprüfung anhand eines realistischen Szenarios zu verlangen – etwa mit ähnlichen Dokumenten, vergleichbarer Anfragelänge und der erwarteten Anzahl gleichzeitiger Nutzer. Dabei kann es sich um einen technischen Proof of Concept handeln, also eine kurze Prüfung, ob die Lösung unter den gegebenen Bedingungen funktioniert, oder um einen Pilotbetrieb für ein ausgewähltes Team. Die Form variiert je nach Anbieter und Projektgröße, das Ziel bleibt jedoch stets dasselbe: noch vor der Investition herauszufinden, ob die Leistung aus der Präsentation mit der Realität im Unternehmen Schritt hält.

Wie ein RAG-Assistent in Dokumenten sucht

Ein RAG-Assistent sucht in Dokumenten nicht Wort für Wort. Jedes Dokument wird zunächst in ein Embedding umgewandelt – einen numerischen Vektor, der seine ungefähre Bedeutung erfasst. Diese Vektoren werden in einer Vektordatenbank gespeichert, und bei einer Anfrage wird nach denjenigen gesucht, die dem Vektor der Anfrage selbst am ähnlichsten sind. Es handelt sich also um eine semantische Suche und nicht um eine Stichwortsuche: Das System findet relevante Passagen selbst dann, wenn das exakte Wort der Anfrage darin fehlt.

Die Leistung dieses Prozesses hängt von der Größe der Vektordatenbank, der Geschwindigkeit des Embedding-Modells und der Latenz der Suchabfrage ab. Ein produktives RAG umfasst daher nicht nur ein Sprachmodell, sondern eine gesamte Pipeline: Embedding-Modell, Vektordatenbank, Reranker und Anwendungsschicht. Jede dieser Komponenten erhöht die Latenz und stellt einen potenziellen Engpass dar, der in einem Benchmark ohne RAG schlichtweg nicht sichtbar wird.

Ein Server kann ausreichen, wenn Sie wissen, was Sie von ihm erwarten

Für die Entwicklung, das Testen kleinerer Modelle oder einen internen Assistenten für einen begrenzten Personenkreis kann ein einzelner leistungsstarker KI-Server eine sehr gute Lösung sein. Das Unternehmen behält die Kontrolle über seine Daten, profitiert von einem stabileren Kostenrahmen und kann Modelle anpassen, ohne ständig sensible Eingaben an einen externen Dienst zu senden. Bei vorhersehbarer Auslastung kann eine eigene Infrastruktur wirtschaftlich sinnvoller sein als die dauerhafte Bezahlung von Cloud-Kapazitäten.

Bei einer einzelnen Maschine muss vor allem an Lastspitzen und die Hochverfügbarkeit des Dienstes gedacht werden. Bedient der Server eine geschäftskritische Anwendung, muss ein Teil der Leistung als Betriebspuffer reserviert bleiben. Ebenso sind Aktualisierungen des Modells, der Treiber oder der Inference Engine erforderlich, die das Verhalten des gesamten Dienstes vorübergehend verändern und dessen Leistung beeinflussen können. Sobald der KI-Assistent von einem begrenzten Einsatz in den Arbeitsalltag mehrerer Teams übergeht, wird die Modellreplikation, der Einsatz mehrerer GPUs oder ein Cluster aus mehreren Servern sinnvoll.

Die Cloud hat ihre Stärken dort, wo sich Arbeitslasten ändern, sprunghaft ansteigen oder das passende Modell erst noch ermittelt werden muss. Ein eigener Server eignet sich besser, sobald das Unternehmen das Betriebsprofil kennt und weiß, dass die Infrastruktur regelmäßig genutzt wird. Die Entscheidung sollte daher nicht allein auf dem Vergleich zwischen Anschaffungskosten des Servers und Cloud-Preisen basieren, sondern auch darauf, wie stabil die Auslastung sein wird, wie sensibel die Daten sind und wie hoch der Verwaltungsaufwand für die gesamte Umgebung ausfällt.

Szenario Was üblicherweise sinnvoll ist
Erste Experimente mit KI Cloud oder ein kleinerer lokaler Testserver
Interner Chatbot für ein Team Ein leistungsstärkerer Server mit Puffer
RAG auf Unternehmensdokumenten Nach End-to-End-Latenz und Kontextlänge dimensionierter Server
Assistent für hunderte Nutzer Mehrere GPUs, Modellreplikation oder Cluster
Sensible Daten und stabiler Betrieb Eigene Infrastruktur oder Hybridmodell
Unregelmäßige Lastspitzen Cloud-Kapazität als Ergänzung
Ein Server reicht aus

Wie Sie einen Benchmark beauftragen, der geschäftlichen Wert hat

Ein guter Kapazitätstest beginnt mit der Beschreibung des Dienstes, nicht mit der Auswahl der GPU. Ein Unternehmen sollte wissen, welche Nutzergruppen das System verwenden werden, welche Fragen sie stellen, wie lange Dokumente verarbeitet werden sollen und welche Antwortzeit noch akzeptabel ist. Ohne diese Vorgaben wird der Benchmark zu einer reinen Technikübung, die mit dem künftigen Produktivbetrieb kaum etwas gemein haben dürfte.

Das technische Team sollte nicht nur die durchschnittliche Antwortzeit messen, sondern auch die p95- und p99-Latenz. Diese Werte geben an, innerhalb welcher Zeitspanne 95 bzw. 99 % der Anfragen beantwortet werden, und decken langsame Antworten auf, die im Durchschnitt leicht untergehen. Im Unternehmensbetrieb sind häufig Lastspitzen, lange Dokumente und atypische Anfragen ausschlaggebend, da sich dort die tatsächliche Leistungsreserve der Infrastruktur zeigt. Im Test sollten dieselben Komponenten eingesetzt werden wie im späteren Produktivbetrieb: Nutzt die Anwendung RAG, muss auch die Dokumentensuche Teil des Benchmarks sein. Soll auf Deutsch geantwortet werden, müssen deutsche Anfragen getestet werden, und wenn die Nutzer lange Anhänge senden, ist ein kurzer Beispiel-Prompt für eine Kapazitätsentscheidung irreführend.

In der Praxis genügt es, mit fünf Kennzahlen zu beginnen, die die technische Leistung des Servers in den realen Unternehmensbetrieb übersetzen.

Was sollten Sie vor dem Benchmark eines KI-Servers klären?

  • Zielzeit bis zur ersten sichtbaren Antwort – Bestimmt, wie schnell der Nutzer erkennen soll, dass das System mit der Arbeit begonnen hat. Bei einem Chatbot ist dies oft entscheidender als die Gesamtzeit bis zur Fertigstellung der Antwort.
  • Gewünschte Generierungsgeschwindigkeit – Zeigt, wie viele Token pro Sekunde der Nutzer erhalten soll, damit die Antwort flüssig wirkt und im Arbeitsalltag praktisch nutzbar ist.
  • Durchschnittliche Eingabelänge – Längere Anfragen oder angehängte Dokumente erhöhen den Speicherbedarf und den Verarbeitungsaufwand vor der eigentlichen Antwortgenerierung.
  • Durchschnittliche Ausgabelänge – Je längere Antworten das Modell erzeugen soll, desto länger bindet es die Rechenkapazität des Servers.
  • Anzahl gleichzeitiger Nutzer zu Spitzenzeiten – Für die Dimensionierung der Infrastruktur ist die tatsächliche Gleichzeitigkeit wichtiger als die Gesamtzahl der Personen, die Zugriff auf den Dienst haben.

Sobald diese Zahlen vorliegen, lässt sich ein Server anhand der Realität vergleichen und nicht anhand von Marketingparametern. Ohne sie wird die Wahl der Infrastruktur schnell zu einer kostspieligen Wette darauf, dass die Leistung im Datenblatt dem tatsächlichen Unternehmensbetrieb entspricht.

Die entscheidende Frage bei der Auswahl eines KI-Servers lautet daher nicht, wie leistungsfähig die verbaute GPU ist. Weitaus aufschlussreicher ist es zu ermitteln, wie viele Token pro Sekunde das System in einer konkreten Anwendung, mit einem bestimmten Modell, bei einer definierten Kontextlänge und inklusive Puffer für Lastspitzen liefern kann. Genau hier entsteht der Unterschied zwischen einem KI-Server, der in einer Präsentation glänzt, und einer Infrastruktur, die den Mitarbeitern die Arbeit spürbar erleichtert. Ein Unternehmen, das KI ernsthaft einsetzen möchte, sollte daher mit einem einfachen Kapazitätsmodell und einem praxisnahen Pilotprojekt starten – nicht um den Kauf zu verzögern, sondern um Geld für Leistung auszugeben, die sich im Echtbetrieb bemerkbar macht und sich künftig sinnvoll skalieren lässt. Bei KI-Servern ist schließlich nicht schwächere Hardware am teuersten, sondern Leistung, die niemand richtig zu nutzen weiß.

Was bedeutet TTFT bei einem KI-Server?

TTFT (Time to First Token) bezeichnet die Zeitspanne vom Absenden der Anfrage bis zu dem Moment, in dem der erste Teil der Antwort auf dem Bildschirm erscheint. Für das Nutzererlebnis ist die TTFT oft wichtiger als die Gesamtdauer bis zur vollständigen Antwort: Reagiert der Server zügig, wirkt die Anwendung reaktionsschnell, auch wenn die vollständige Fertigstellung etwas länger dauert.

Wie ermitteln Sie, wie viele Nutzer ein KI-Server bewältigt?

Die entscheidende Metrik ist nicht die Anzahl registrierter Nutzer, sondern die Zahl der gleichzeitig generierten Antworten. Grundlegende Berechnung: Teilen Sie die Gesamtleistung des Servers in Token pro Sekunde durch die Anzahl der Token pro Sekunde, die Sie einem einzelnen Nutzer bereitstellen möchten. Ziehen Sie vom Ergebnis einen Puffer für Lastspitzen ab (typischerweise 20–30 %). Eine genauere Zahl erhalten Sie durch ein Pilotprojekt oder einen Benchmark mit realistischen Anfragen.

Was ist der KV-Cache und warum hängt die Leistung von der Kontextlänge ab?

Der KV-Cache speichert Zwischenberechnungen für jedes Token im aktuellen Kontext. Je länger der Kontext, desto mehr VRAM verbraucht der KV-Cache – und desto weniger gleichzeitige Sessions passen in den Arbeitsspeicher. Bei RAG-Assistenten, die mit langen Dokumenten arbeiten, ist eine korrekte Dimensionierung des KV-Caches daher genauso wichtig wie die Rechenleistung der GPU.

Was ist RAG und wie beeinflusst es die Leistung eines KI-Servers?

RAG (Retrieval-Augmented Generation) ist eine Methode, bei der der Assistent vor der Generierung einer Antwort interne Dokumente durchsucht und die relevanten Abschnitte einbezieht. RAG erhöht die Genauigkeit bei unternehmensspezifischen Themen, verursacht jedoch zusätzliche Latenz, da Suchprozess, Embedding und Reranking der eigentlichen Generierung vorgeschaltet sind. Ein Benchmark ohne RAG-Pipeline unterschätzt daher die Belastung eines produktiven RAG-Assistenten.

Wann lohnt sich die Anschaffung eines eigenen KI-Servers anstelle der Cloud?

Ein eigener Server ist bei vorhersehbarer und stabiler Auslastung, beim Umgang mit sensiblen Daten oder dann sinnvoll, wenn die laufenden Cloud-Kosten bei regelmäßigem Betrieb die Anschaffungskosten eines Servers übersteigen. Die Cloud erweist sich als vorteilhafter bei schwankender Last, schnellem Wachstum oder wenn ein Unternehmen das passende Modell und Einsatzszenario erst noch evaluiert.

Was bedeutet Modellquantisierung und wann sollte man sie einsetzen?

Die Quantisierung reduziert die Genauigkeit der Modellgewichte (beispielsweise von 32-Bit-Zahlen auf 8-Bit- oder 4-Bit-Werte), wodurch der VRAM-Bedarf sinkt und die Generierung beschleunigt wird. Bei einfachen internen Assistenten stellt dies einen vernünftigen Kompromiss dar. Bei juristischen, finanziellen oder technischen Ergebnissen empfiehlt es sich zu prüfen, ob die verringerte Präzision die Antwortqualität bei der konkreten Aufgabe beeinträchtigt.

4.5 7×
Watch Price/Availability
NVIDIA DGX Spark
Work Station , NVIDIA GB10, NVIDIA GB10 128GB, RAM 128GB LPDDR5x, SSD 4000GB, Without Optical Drive, Wi-Fi, HDMI and USB-C, Case Type: SFF, NVIDIA DGX OS 7
  6,839 €
Buy
In stock > 5 pcs
Order Code: NRn2000
5.0 1×
Watch Price/Availability
Inter-Tech IPC 4U-40255 - Rack 4U
PC Case - ATX, mATX (Micro ATX), mITX (Mini ITX), eATX (Extended ATX), uATX, SSI-CEB and SSI-EEB, 11× 3,5" slot(s), 4× 2,5" slot(s), max. heat sink height: 150mm, max. graphics card length: 330mm, side panel made of
  179.90 €
Buy
Ordered on request
Order Code: ITEsipc18
Watch Price/Availability
Inter-Tech IPC 4U-4724 - Rack 4U
PC Case - ATX, mATX (Micro ATX), mITX (Mini ITX), eATX (Extended ATX) and SSI-EEB, 2× 2,5" slot(s), USB 3.2 Gen 1, 2×80mm, max. heat sink height: 155mm, max. graphics card length: 340mm, without power supply, side panel made of steel
  612.90 €
Buy
In stock 1 pcs
Order Code: ITEcsipc09
Watch Price/Availability
MSI Cubi 5 1M-440BEU
Mini PC , Intel Core 3 100U 4,7 GHz, Intel Graphics, RAM 0GB DDR5-SDRAM, SSD 0GB, Without Optical Drive, Wi-Fi, HDMI, DisplayPort and Thunderbolt, Case Type: Micro Tower, without Operating System
  262.90 €
Currently Unavailable
Order Code: TB237a3n33
Watch Price/Availability
MSI Cubi NUC AI+ 3MG-002EU
Mini PC , Intel Core Ultra 9 386H 4,9 GHz, Intel Graphics, RAM 32GB DDR5-SDRAM, SSD 1000GB, Without Optical Drive, Wi-Fi, HDMI and Thunderbolt, 1× USB 2.0, Case Type: Mini ITX, Windows 11 Pro
  1,609 €
Buy
Ordered on request
Order Code: TB237a3n49
Watch Price/Availability
NVIDIA RTX PRO 6000 Blackwell Server Edition Short Bracket Passive 96GB
Graphics Card for Businesses - 96GB GDDR7 (28000MHz), NVIDIA Blackwell (GB202, 1590 MHz), Boost 2288 MHz, PCI Express x16 5.0, 512Bit, DisplayPort 2.1, width 266,7 mm
Pre-sale price 17,079 €
Currently Unavailable
Order Code: NVrpbs02
Watch Price/Availability
NVIDIA H200 NVL Passive PCIe 141GB with NVIDIA AI Enterprise
Graphics Card for Businesses - 141GB HBM3e (6400MHz), NVIDIA (GH100, 1365 MHz), Boost 1785 MHz, PCI Express x16 5.0, 6144Bit, width 266,7 mm
Pre-sale price 32,579 €
Currently Unavailable
Order Code: NVh01
Watch Price/Availability
HP ZGX Nano G1n AI
Work Station , NVIDIA GB10, NVIDIA GB10 128GB, RAM 128GB LPDDR5x, SSD 4000GB, Wi-Fi, HDMI, Case Type: SFF, NVIDIA DGX OS 7
Currently Unavailable
Order Code: HPBD5024d1
Watch Price/Availability
MSI Cubi NUC AI+ 3MG-003EU
Mini PC , Intel Core Ultra 7 355 4,7 GHz, Intel Graphics, RAM 16GB DDR5-SDRAM, SSD 1000GB, Without Optical Drive, Wi-Fi, HDMI and Thunderbolt, 1× USB 2.0, Case Type: Mini ITX, Windows 11 Pro
  1,229 €
Buy
In stock > 5 pcs
Order Code: TB237a3n50
Watch Price/Availability
NVIDIA RTX PRO 2000 16GB Blackwell Low Profile
Graphics Card - 16GB GDDR7 (18000MHz), NVIDIA Blackwell (GB206, 790 MHz), Boost 1950 MHz, PCI Express x16 5.0, 128Bit, mini DisplayPort 2.1, width 167,64 mm
  1,639 €
Buy
In stock 3 pcs
Order Code: NVrpr08
Watch Price/Availability
NVIDIA RTX PRO 4500 32GB Blackwell
Graphics Card - 32GB GDDR7 (28000MHz), NVIDIA Blackwell (GB203, 1590 MHz), Boost 2617 MHz, PCI Express x16 5.0, 256Bit, DisplayPort 2.1b, width 266,7 mm
  4,779 €
Buy
In stock > 5 pcs
Order Code: NVrpr05
5.0 1×
Watch Price/Availability
NVIDIA RTX PRO 5000 48GB Blackwell
Graphics Card - 48GB GDDR7 (28000MHz), NVIDIA Blackwell (GB202, 1590 MHz), Boost 2617 MHz, PCI Express x16 5.0, 384Bit, DisplayPort 2.1b, width 266,7 mm
  8,119 €
Buy
In stock 3 pcs
Order Code: NVrpr04
Print
P-DC1-WEB30

Studieren lohnt sich Mit Studentenrabatten auf alle ISIC/ITIC Karten More info »