← Zurück zu News
Technik & Modelle 25. September 2026

Qwen3.8-27B im Praxistest: Man vergisst, dass die KI im eigenen Haus läuft

Wir haben angekündigt, das Modell selbst zu prüfen. Nach mehreren Tagen im Dauerbetrieb auf einer einzelnen Grafikkarte ist unser Urteil eindeutig: bis zu 200 Zeichenbausteine pro Sekunde, Programmieraufgaben in Sekunden, Web-Recherche und Dokumentaufbereitung auf einem Niveau, das wir bisher nur aus der Cloud kannten. Dazu die Zahlen aus unabhängigen Tests, auch im direkten Vergleich mit Claude.

Kurz gesagt

Ende August haben wir über Qwen3.8-27B geschrieben und versprochen, die Herstellerzahlen nicht einfach weiterzugeben, sondern selbst nachzuprüfen. Das haben wir getan, auf einer einzelnen Grafikkarte und mit echten Aufgaben aus unserem Alltag.

Das Ergebnis hat uns ehrlich überrascht. Qwen3.8-27B lässt einen vergessen, dass man lokal arbeitet. Es ist nicht einfach ein Modell, das Dokumente durchsucht oder Texte zusammenfasst. Es plant, programmiert, recherchiert im Web und bereitet Unterlagen auf, und zwar in einer Qualität und Geschwindigkeit, die wir bisher nur von den großen Cloud-Anbietern kannten.

Unsere Messwerte mit Qwen3.8-27B auf einer RTX 5090 Bis zu 200 Tokens pro Sekunde bei Text, bis zu 170 Tokens pro Sekunde bei Aufgaben mit Bildern, 128.000 Tokens Kontext, eine einzelne Grafikkarte. Einrichtung in wenigen Stunden, seit Tagen stabil im Dauerbetrieb. Unser Aufbau in Zahlen Eine NVIDIA RTX 5090 · 128 GB DDR5-RAM · vLLM · eigenes Netzwerk · Stand September 2026 200 Tokens pro Sek. bei Text 170 Tokens pro Sek. mit Bildern 128k Tokens Kontext ohne Probleme 1 Grafikkarte seit Tagen stabil
200 Tokens pro Sekunde sind etwa 150 Wörter pro Sekunde, weit mehr, als ein Mensch mitlesen kann. Die Antwort steht praktisch sofort da.

Der Aufbau: eine Karte, einige Stunden, seitdem Ruhe

Getestet haben wir auf einer einzelnen NVIDIA GeForce RTX 5090 mit 32 GB Grafikspeicher, der Rechner dazu hat 128 GB DDR5-Arbeitsspeicher. Betrieben wird das Modell über vLLM, die Software, über die wir Sprachmodelle auch in ZAjONiC einbinden. Der Kontextspeicher steht auf 128.000 Zeichenbausteinen, das sind mehrere hundert Seiten, die das Modell gleichzeitig im Blick behält.

Einrichtung, Konfiguration und die Feinabstimmung auf diese Karte waren in wenigen Stunden erledigt. Seitdem läuft das System seit Tagen stabil als KI im eigenen Netzwerk, ohne Neustart und ohne Nacharbeit.

Die Feinabstimmung ist der Teil, der den Unterschied macht. Öffentliche Messungen zeigen, wie weit die Werte auf derselben Hardware auseinanderliegen: Mit einer einfachen Standardeinrichtung erreicht eine RTX 5090 rund 100 Tokens pro Sekunde, mit passender Verkleinerung und vorausschauender Token-Erzeugung gut 200. Unser Wert liegt damit am oberen Ende dessen, was mit dieser Karte heute möglich ist.

Erzeugte Tokens pro Sekunde mit Qwen3.8-27B auf verschiedenen Grafikkarten RTX 3090 in Standardeinrichtung etwa 39 Tokens pro Sekunde. RTX 4090 in Standardeinrichtung etwa 48, mit vorausschauender Token-Erzeugung bis etwa 80. RTX 5090 mit 6-Bit-Verkleinerung etwa 100. RTX 5090 mit llama.cpp und vorausschauender Token-Erzeugung etwa 122. RTX 5090 in unserem abgestimmten vLLM-Aufbau bis zu 200. Wie schnell das Modell antwortet Erzeugte Tokens pro Sekunde, ein Nutzer, eine Grafikkarte RTX 3090, Standard ca. 39 RTX 4090, Standard ca. 48 RTX 4090, abgestimmt 60–80 RTX 5090, Standard ca. 100–122 RTX 5090, unser Aufbau bis 200 vLLM, auf die Karte abgestimmt · mit Bildern bis 170
Fremdwerte aus öffentlichen Messungen (Quellen 3–6), eigener Wert aus unserem Test. Dieselbe Karte liefert je nach Einrichtung die halbe oder die doppelte Geschwindigkeit.

Der eigentliche Test: ein Programmier-Agent, ganz ohne Cloud

Schnell zu antworten ist das eine. Wir wollten wissen, ob das Modell auch selbstständig arbeiten kann. Deshalb haben wir es an einen Programmier-Agenten angeschlossen: an Claude Code bzw. das offene Gegenstück OpenCode, also genau die Werkzeuge, mit denen Entwickler heute mit den großen Cloud-Modellen arbeiten. Nur dass hier Qwen3.8-27B alles übernommen hat: das Nachdenken und Planen, das Schreiben des Codes und den Zugang ins Web, um selbst zu recherchieren.

Was dabei herauskam:

  • Einfache Programmieraufgaben waren in wenigen Sekunden gelöst. Nicht in Minuten, sondern in der Zeit, die man braucht, um die Aufgabe noch einmal durchzulesen.
  • Auch komplexere Sachverhalte hat das Modell vollständig erfasst und gelöst. Es hat die Aufgabe zerlegt, Zusammenhänge erkannt und im Netz nachgeschlagen, wo ihm Wissen fehlte.
  • Der Direktvergleich mit Claude Opus. Parallel dazu lief Claude Code mit Opus an denselben Aufgaben. Bei manchen davon hat das Cloud-Modell länger gebraucht als das lokale.
  • Mit 128.000 Tokens Kontext ohne Probleme. Auch lange Arbeitssitzungen mit vielen Dateien blieben stabil.

Das deckt sich mit Berichten anderer Teams, die Qwen3.8-27B als lokalen Ersatz in Claude Code einsetzen: Für klar umrissene Programmierarbeit, für Umbauten, Testkorrekturen und Oberflächen gilt das Modell dort als vollwertige Arbeitsebene und nicht bloß als Spielzeug.

In unserer Software: Präsentationen, Daten, Plugins

Über vLLM haben wir das Modell auch in ZAjONiC eingebunden. Egal ob es um die Aufbereitung von Inhalten für Präsentationen, das Verarbeiten von Daten oder die Arbeit mit unserem Plugin-Generator ging, die Ergebnisse haben überzeugt.

Was uns buchstäblich vom Hocker gehauen hat: die Aufbereitung von Dokumenten zu einer ansprechenden Darstellung. Aus einem nüchternen Dokument wurde eine gegliederte HTML-Seite mit sauber strukturierten Daten und Animationen. Diese Ergebnisse müssen sich vor keinem Cloud-Modell verstecken.

Und die Sprache? Die war dem Modell völlig gleich. Deutsch, Englisch, gemischte Unterlagen, alles wurde korrekt verstanden, ausgegeben und dargestellt. Damit ist die Frage beantwortet, die wir im ersten Beitrag als wichtigste offene genannt hatten.

Und was sagen die Benchmarks? Der Vergleich mit Claude

Ein eigener Test sagt viel über den eigenen Alltag, aber wenig über den Vergleich. Deshalb haben wir die inzwischen veröffentlichten Messungen zusammengetragen, vor allem zu den beiden Punkten, die uns am meisten beeindruckt haben: Programmieren und Schlussfolgern (Reasoning).

Alibaba hat Qwen3.8-27B in der Modellkarte selbst mit Claude Opus 4.6 Max verglichen, bis vor wenigen Monaten eines der stärksten Modelle überhaupt. Das Ergebnis: Das Modell mit 27 Milliarden Parametern, das auf eine Grafikkarte passt, liegt bei 16 von 24 Prüfungen vorn.

Qwen3.8-27B und Claude Opus 4.6 Max im Vergleich, acht Prüfverfahren SWE-bench Pro: Qwen3.8-27B 61,7, Claude Opus 4.6 Max 53,4 Punkte. LiveCodeBench v6: Qwen3.8-27B 90,3, Claude Opus 4.6 Max 88,8 Punkte. Terminal-Bench 2.1: Qwen3.8-27B 73, Claude Opus 4.6 Max 78,2 Punkte. NL2Repo: Qwen3.8-27B 42,3, Claude Opus 4.6 Max 47,6 Punkte. IFBench: Qwen3.8-27B 79,5, Claude Opus 4.6 Max 62,5 Punkte. GPQA Diamond: Qwen3.8-27B 89,2, Claude Opus 4.6 Max 91,3 Punkte. Humanity's Last Exam: Qwen3.8-27B 30,8, Claude Opus 4.6 Max 40 Punkte. OSWorld-Verified: Qwen3.8-27B 84,3, Claude Opus 4.6 Max 72,7 Punkte. Programmieren und Reasoning im Vergleich Punkte von 100 · Herstellerangaben Alibaba, August 2026 Qwen3.8-27B (lokal, eine Karte) Claude Opus 4.6 Max (Cloud) SWE-bench Pro echte Fehler in Programmcode beheben 61,7 53,4 LiveCodeBench v6 Programmieraufgaben unter Zeitdruck 90,3 88,8 Terminal-Bench 2.1 selbstständig in der Kommandozeile arbeiten 73,0 78,2 NL2Repo ganzes Software-Projekt aus einer Beschreibung 42,3 47,6 IFBench Anweisungen genau befolgen 79,5 62,5 GPQA Diamond Schlussfolgern auf Fachniveau 89,2 91,3 Humanity's Last Exam die schwersten Wissensfragen 30,8 40,0 OSWorld-Verified einen Rechner per Bildschirm bedienen 84,3 72,7
Fett markiert ist jeweils das stärkere Modell. Qwen gewinnt beim Beheben echter Programmfehler, beim genauen Befolgen von Anweisungen und beim Bedienen eines Rechners. Claude bleibt vorn bei den schwersten Wissensfragen und bei großen, zusammenhängenden Software-Projekten.

Wie belastbar sind diese Zahlen?

Herstellerzahlen bleiben Herstellerzahlen. Die Prüfumgebungen sind nicht in jedem Punkt identisch, der Vorsprung beim Programmieren ist deshalb als Größenordnung zu lesen, nicht auf die Kommastelle. Umso wichtiger sind die unabhängigen Messungen, die seit dem ersten Beitrag hinzugekommen sind:

  • Artificial Analysis Intelligence Index: 52 Punkte. Der unabhängige Gesamtindex aus neun Prüfungen zu Programmieren, Naturwissenschaft, Schlussfolgern und Büroarbeit. Der direkte Vorgänger mit gleicher Größe kam auf 38. Das ist ein Sprung von 14 Punkten, allein durch besseres Training.
  • Agentic Index: 51 Punkte, vor Claude Opus 4.8. Beim selbstständigen Abarbeiten mehrschrittiger Aufgaben liegt Qwen3.8-27B unabhängig gemessen knapp vor Claude Opus 4.8 in höchster Denkstufe, dem Spitzenmodell von Anthropic bis zum Frühjahr.
  • ExtractBench: 89,75 Punkte. Beim Herausziehen strukturierter Daten aus Dokumenten, gemessen von LlamaIndex, bei kurzen Dokumenten sogar 94,7. Das passt zu dem, was wir bei der Dokumentaufbereitung gesehen haben.

Zur Einordnung nach oben: Das derzeit stärkste Modell von Anthropic, Claude Opus 5.5, erreicht im selben Gesamtindex 58 Punkte und führt ihn damit an. Der Abstand zwischen einem lokalen Modell auf einer Grafikkarte und der absoluten Spitze der Cloud beträgt also sechs Punkte.

Artificial Analysis Intelligence Index im Vergleich Qwen3.6-27B 38 Punkte, Qwen3.8-27B 52 Punkte, Claude Opus 5.5 58 Punkte, derzeit Spitzenreiter. Unabhängig gemessen: der Abstand zur Spitze Artificial Analysis Intelligence Index, höchste Denkstufe Qwen3.6-27B Vorgänger, gleiche Größe 38 Qwen3.8-27B lokal, eine Grafikkarte 52 Claude Opus 5.5 Cloud, derzeit Platz 1 58
Qwen3.8-27B gemessen im August, Claude Opus 5.5 im September 2026. Der Index wird laufend weiterentwickelt, die Werte sind als Größenordnung zu lesen.

Wo Claude vorn bleibt, und warum das kein Widerspruch ist

Zur ehrlichen Bilanz gehört, wo die großen Cloud-Modelle weiterhin stärker sind. Die Messungen zeigen drei Bereiche:

  • Die schwersten Wissensfragen. Bei „Humanity's Last Exam“ liegt schon Opus 4.6 Max mit 40 gegen 30,8 Punkte deutlich vorn. Wer Spitzenwissen aus sehr vielen Fachgebieten gleichzeitig braucht, profitiert von der schieren Größe der Cloud-Modelle.
  • Lange, unbeaufsichtigte Läufe. Beim selbstständigen Arbeiten in der Kommandozeile und beim Aufbau ganzer Software-Projekte hat Claude die Nase vorn (78,2 gegen 73,0 bzw. 47,6 gegen 42,3).
  • Denkaufwand. Das Modell ist ab Werk auf sehr gründliches Nachdenken eingestellt und verbraucht dabei ein Vielfaches an Tokens. Im Indextest waren es 160 Millionen gegenüber einem Mittel von 43 Millionen bei vergleichbaren Modellen. Ohne Anpassung dauert eine einfache Aufgabe unnötig lange. Genau hier setzt die Feinabstimmung an, die bei uns die Geschwindigkeit bringt.

Daraus folgt keine Entweder-oder-Entscheidung, sondern eine Aufgabenteilung. Der Großteil der täglichen Arbeit, also Texte, Daten, Dokumente, Programmierung mit klarer Aufgabe, lässt sich vollständig im eigenen Haus erledigen. Für die wenigen Fälle an der absoluten Leistungsgrenze bleibt der Weg in die Cloud offen, wenn man ihn gehen will.

Was als Nächstes kommt

Besonders spannend ist, wohin sich das bewegt. Die Verkleinerung der Modelle, die sogenannte Quantisierung, schreitet schnell voran, und mit jeder Generation wird besser verstanden, wie man ein Modell auf eine bestimmte Hardware abstimmt. Dieselbe Grafikkarte, die heute 200 Tokens pro Sekunde liefert, lieferte mit den Einstellungen vom Erscheinungstag gerade einmal die Hälfte.

Für die großen Anbieter wird es damit spürbar schwerer. Wenn ein zugegeben kräftiger, aber ganz normaler Rechner im eigenen Haus solche Ergebnisse liefert, und das ohne laufende Kosten pro Token, abgesehen vom Strom, dann ändert sich die Rechnung für jedes Unternehmen und jede Verwaltung, die heute für jede Anfrage bezahlt.

Häufige Fragen

Auf welcher Hardware lief der Test?
Auf einer einzelnen NVIDIA GeForce RTX 5090 mit 32 GB Grafikspeicher in einem Rechner mit 128 GB DDR5-Arbeitsspeicher. Das Modell lief über vLLM, eine verbreitete Software für den Betrieb von Sprachmodellen, mit einem Kontextspeicher von 128.000 Zeichenbausteinen. Einrichtung und Feinabstimmung haben einige Stunden gedauert, seitdem läuft das System seit Tagen stabil als KI im eigenen Netzwerk.
Wie schnell ist das Modell auf einer RTX 5090?
In unserem Aufbau bis zu 200 Zeichenbausteine (Tokens) pro Sekunde bei Text und bis zu 170 bei Aufgaben mit Bildern. Das ist deutlich schneller, als man lesen kann, und liegt im Bereich der besten öffentlich berichteten Werte für diese Karte. Ohne Feinabstimmung werden auf derselben Karte oft nur 70 bis 120 Tokens pro Sekunde erreicht.
Ist Qwen3.8-27B so gut wie Claude?
In Teilen ja, insgesamt nein. In den Herstellertests schlägt es Claude Opus 4.6 Max bei 16 von 24 Prüfungen, etwa beim Beheben echter Programmfehler und beim Bedienen eines Rechners. Im unabhängigen Gesamtindex von Artificial Analysis liegt es mit 52 Punkten hinter dem aktuellen Spitzenmodell Claude Opus 5.5 mit 58 Punkten. Bei den schwersten Wissens- und Langzeitaufgaben bleibt Claude vorn. Für einen Großteil der täglichen Arbeit reicht die lokale Leistung aber vollständig.
Kann man das Modell mit Claude Code oder OpenCode verwenden?
Ja. Programmier-Agenten wie Claude Code oder das offene OpenCode lassen sich auf ein lokal betriebenes Modell umstellen. In unserem Test hat Qwen3.8-27B darin das Planen, das Programmieren und die Recherche im Web übernommen, ohne ein externes Modell.
Funktioniert das Modell auf Deutsch?
Ja. Im Ursprungsbeitrag war die deutsche Sprache noch unsere wichtigste offene Frage. Im Test hat das Modell Deutsch und Englisch gleichermaßen sicher verstanden und korrekt ausgegeben, auch bei Umlauten, Fachbegriffen und bei gemischtsprachigen Unterlagen.
Was kostet der Betrieb?
Nach der Anschaffung der Hardware fallen keine Gebühren pro Anfrage an, nur Strom. Das Modell steht unter der Apache-2.0-Lizenz und darf kommerziell genutzt werden. Welche Hardware für den eigenen Fall passt, zeigen unsere vier Ausbaustufen für lokale KI.
Wo liegen die Grenzen?
Das Modell denkt in der Grundeinstellung sehr gründlich und verbraucht dabei viele Tokens; ohne Anpassung der Denktiefe kann eine einfache Aufgabe unnötig lange dauern. Bei sehr langen, unbeaufsichtigten Agenten-Läufen und bei den schwersten Wissensfragen liegen die großen Cloud-Modelle weiter vorn. Beides spricht für eine bewusste Aufgabenteilung, nicht gegen den lokalen Betrieb.

Quellen

  1. Qwen / Alibaba – Modellkarte „Qwen3.8-27B“, August 2026 – huggingface.co
  2. VentureBeat – „Qwen3.8-27B runs frontier-class coding agents and reasoning locally“, August 2026 – venturebeat.com
  3. Qubrid AI – „Qwen3.8-27B Benchmarks: Official and Independent Results“, 2026 – qubrid.com
  4. Codersera – „Qwen3.8-27B as a Local Claude Code Replacement“, 2026 – codersera.com
  5. Tom's Hardware – „Benchmarking Qwen 3.8 27B on RTX 5090 and beyond“, 2026 – tomshardware.com
  6. Unsloth / Hugging Face – „Performance report on RTX 5090“, 2026 – huggingface.co
  7. Artificial Analysis – „Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index“, 22.09.2026 – artificialanalysis.ai
  8. MindStudio – „Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests“, 20.08.2026 – mindstudio.ai

Die Werte zu Geschwindigkeit, Kontext und Betriebsdauer stammen aus unserem eigenen Test auf einer NVIDIA GeForce RTX 5090 mit 128 GB DDR5-Arbeitsspeicher und vLLM; auf anderer Hardware oder mit anderer Einrichtung weichen sie ab. Die Vergleichswerte mit Claude Opus 4.6 Max sind Herstellerangaben von Alibaba, die Index-Werte stammen von Artificial Analysis und LlamaIndex. Modellstände und Ranglisten ändern sich laufend. Stand: 25. September 2026.

Sehen Sie es sich selbst an

Wir zeigen Ihnen das Modell im Betrieb, mit Ihren eigenen Unterlagen, und rechnen durch, was eine lokale KI dieser Klasse bei Ihnen kosten würde.

Kontakt aufnehmen →