Qwen
Alibaba Cloud (Qwen-Team)
Redaktionelle Einschätzung auf Basis öffentlich zugänglicher Quellen (Anbieterangaben, Preislisten, unabhängige Bewertungsplattformen), kein Hands-on-Produkttest, sofern nicht ausdrücklich anders angegeben. Die Sternebewertung ist eine Meinung der Redaktion.
Tool öffnenQwen ist die Open-Weight-Modellfamilie von Alibaba, die du lokal mit Ollama betreibst oder per API aus Singapur oder Frankfurt nutzt. Das Mittelklassemodell Qwen3.8-27B steht unter Apache 2.0, versteht Text, Bilder und Videos und verarbeitet nativ 262.144 Tokens. Per API kostet Qwen3.8-Flash 0,15 USD je Million Input-Tokens. Schwachpunkte sind die uneinheitlichen Lizenzen innerhalb einer Generation, die fehlende EU-Inferenz für die neuen Generationen in Frankfurt und Qwen Studio (chat.qwen.ai), das Eingaben laut Datenschutzerklärung in Singapur und Festlandchina speichert.
Kosten: Modellgewichte kostenlos: Qwen3.8-27B unter Apache 2.0, das Flaggschiff Qwen3.8-2.4T-A95B unter der Qwen3.8-Max License, Qwen3.8-Flash-Next unter der Qwen Community License 1.0. API über Alibaba Cloud Model Studio, Region Singapur: Qwen3.8-Max 2 USD Input und 6 USD Output je 1 Mio. Tokens, Qwen3.8-Flash 0,15 und 0,47 USD, Qwen3.8-27B 0,50 und 3 USD, 1 Mio. Gratis-Tokens für 90 Tage nur in Singapur. Region Frankfurt (Bereitstellung Global): Qwen3.8-Max 1,65 und 4,951 USD, Qwen3.8-Flash 0,113 und 0,382 USD. Hardware beim Selbstbetrieb zahlst du selbst.
Stärken
- Qwen3.8-27B unter Apache 2.0: kommerziell nutzbar ohne Nutzerschwelle und ohne Pflicht zur Namensnennung in der Oberfläche
- Sehr breite Auswahl: 465 Modelle auf Hugging Face, von Spezialmodellen wie dem Spracherkennungsmodell Qwen3-ASR-0.6B bis zum 2,4-Billionen-Flaggschiff
- Qwen3.8-27B versteht Text, Bilder und Videos und verarbeitet nativ 262.144 Tokens, erweiterbar bis 1 Mio.
- Lokal in Ollama als 18-GB-Download verfügbar, inklusive MLX-Variante für Apple-Rechner
- Günstige API: Qwen3.8-Flash kostet 0,15 USD je 1 Mio. Input-Tokens, 1 Mio. Gratis-Tokens in Singapur
- Model-Studio-Region Frankfurt mit wählbarem EU-Bereitstellungsumfang für ausgewählte Modelle
Einschränkungen
- Lizenz-Flickenteppich: Flaggschiff und Flash-Next laufen unter eigenen Qwen-Lizenzen, und die Community License von Flash-Next verlangt für Model-as-a-Service und KI-Arbeitsassistenten eine gesonderte Lizenz ohne Umsatzschwelle
- Die Generationen Qwen3.6, Qwen3.7 und Qwen3.8 gibt es in Frankfurt nur mit globalem Bereitstellungsumfang, die Inferenz kann also außerhalb der EU laufen
- Qwen Studio (chat.qwen.ai) speichert Daten laut Datenschutzerklärung in Singapur und Festlandchina und nutzt de-identifizierte Eingaben und Feedback für das Modelltraining
- Das Flaggschiff Qwen3.8-2.4T-A95B ist mit 2,4 Billionen Parametern für eigene Server im Mittelstand praktisch unerreichbar
- Kein deutschsprachiger Support, Anbieter mit Sitz außerhalb der EU
- Herkunft aus China ist in manchen Branchen und Behörden ein Ausschlusskriterium, unabhängig von der Technik
Passt gut zu
Wann ja, wann nein
Wann ja
- Du willst ein leistungsfähiges Sprachmodell unter Apache 2.0 auf eigener Hardware betreiben
- Du brauchst eine günstige API für hohe Token-Mengen und kannst Daten ohne Personenbezug verarbeiten
- Du willst Text und Bilder lokal auswerten, Videos zusätzlich über vLLM oder SGLang
- Du baust ein Produkt und willst das Modell später ohne Anbieterwechsel selbst hosten können
Wann nein
- Du brauchst die neueste Modellgeneration mit garantierter Inferenz in der EU über die API
- Du suchst einen fertigen Chat-Assistenten für personenbezogene Daten, denn Qwen Studio speichert Eingaben in Singapur und Festlandchina
- Deine Compliance schließt Modelle chinesischer Anbieter grundsätzlich aus
- Du willst einen deutschen oder europäischen Vertragspartner mit deutschsprachigem Support
Kurzfazit
Qwen ist Alibabas Open-Weight-Modellfamilie und die naheliegende Wahl, wenn du ein starkes Sprachmodell selbst betreiben willst. Qwen3.8-27B steht unter Apache 2.0, lädt in Ollama als 18-GB-Download und verarbeitet nativ 262.144 Tokens, per API kostet Qwen3.8-Flash 0,15 USD je Million Input-Tokens. Schwach sind die uneinheitlichen Lizenzen, die fehlende EU-Inferenz für die neuen Generationen in Frankfurt und Qwen Studio, das Eingaben laut Datenschutzerklärung in Singapur und Festlandchina speichert. Wer einen EU-Vertragspartner braucht, ist bei Mistral besser aufgehoben.
Für wen ist Qwen?
Mittelständler mit eigener IT, die KI im Haus betreiben wollen: Qwen3.8-27B steht unter Apache 2.0. Du darfst das Modell kommerziell einsetzen, anpassen und in eigene Produkte einbauen, ohne Nutzerschwelle und ohne Pflicht, den Modellnamen anzuzeigen. Läuft es auf eigener Hardware, verlässt kein Dokument das Firmennetz, und ein Vertrag mit Alibaba ist gar nicht nötig.
Entwickler und Produktteams: Über Alibaba Cloud Model Studio bekommst du dieselbe Modellfamilie als API, von Qwen3.8-Flash für 0,15 USD je Million Input-Tokens bis Qwen3.8-Max für 2 USD. Der Thinking-Modus von Qwen3.8-27B ist standardmäßig an, lässt sich aber pro Anfrage abschalten und über reasoning_effort dosieren. Wer heute per API startet und morgen selbst hosten will, bleibt in derselben Modellfamilie. Als offiziellen API-Dienst nennen die Modellkarten außerdem Qwen Cloud (qwencloud.com), betrieben von der Intelligent Cloud Computing (Singapore) Private Limited, mit denselben Listenpreisen für Qwen3.8-Max (2 und 6 USD) und Qwen3.8-Flash (0,15 und 0,47 USD) und einem Token Plan für Einzelnutzer ab 6 USD im Monat. Wo Qwen Cloud Daten speichert und welche Datenschutzbedingungen gelten, konnten wir nicht belegen, für personenbezogene Daten empfehlen wir den Dienst deshalb nicht.
Einzelanwender mit leistungsstarkem Rechner: In Ollama liegt Qwen3.8-27B als 18-GB-Download bereit, zusätzlich als MLX-Variante für Apple-Rechner. Für Freiberufler, Berater oder Entwickler, die vertrauliche Texte lokal zusammenfassen oder umformulieren wollen, ist das ein realistischer Einstieg.
Teams mit gemischten Dokumenten: Qwen3.8-27B versteht laut Modellkarte Text, Bilder und Videos, wobei Ollama nur Text und Bilder annimmt und Videos einen Server mit vLLM oder SGLang brauchen. Gescannte Lieferscheine, Fotos von Typenschildern und technische Handbücher lassen sich damit mit einem einzigen Modell auswerten, statt drei Werkzeuge zu verketten.
Weniger geeignet für: Unternehmen, die die neuen Modellgenerationen per API mit garantierter Inferenz in der EU brauchen, denn Qwen3.6, Qwen3.7 und Qwen3.8 gibt es in Frankfurt nur mit globalem Bereitstellungsumfang. Ebenso wenig für alle, die einen fertigen Chat-Assistenten für personenbezogene Daten suchen, denn Qwen Studio speichert Eingaben in Singapur und Festlandchina, und für Organisationen, deren Compliance Modelle chinesischer Anbieter ausschließt.
Preise im Detail
Die Modellgewichte kosten nichts, die Chat-Oberfläche Qwen Studio ist laut Anbieter ebenfalls kostenlos. Bezahlt wird entweder die eigene Hardware oder die Nutzung über Alibaba Cloud Model Studio, abgerechnet je Million Tokens (Stand 17. September 2026, Listenpreise ohne Rabatte).
| Modell | Region und Bereitstellung | Input je 1 Mio. Tokens | Output je 1 Mio. Tokens | Gratis-Kontingent |
|---|---|---|---|---|
| Qwen3.8-Max | Singapur, International | 2,00 USD | 6,00 USD | 1 Mio. Tokens, 90 Tage |
| Qwen3.8-Max | Frankfurt, Global | 1,65 USD | 4,951 USD | keines |
| Qwen3-Max | Frankfurt, EU | 1,20 USD (bis 32K Input) | 6,00 USD | keines |
| Qwen3.8-27B | Singapur, International | 0,50 USD | 3,00 USD | 1 Mio. Tokens, 90 Tage |
| Qwen3.8-Flash | Singapur, International | 0,15 USD | 0,47 USD | 1 Mio. Tokens, 90 Tage |
| Qwen3.8-Flash | Frankfurt, Global | 0,113 USD | 0,382 USD | keines |
| Qwen3.5-Flash | Frankfurt, EU | 0,10 USD | 0,40 USD | keines |
| Qwen3.8-27B selbst betrieben | eigene Hardware | 0 USD Lizenz (Apache 2.0) | 0 USD Lizenz | nicht nötig |
Qwen3-Max im EU-Umfang ist gestaffelt: Anfragen mit 32K bis 128K Input-Tokens kosten 2,40 USD Input und 12 USD Output, bis 256K sind es 3 USD und 15 USD. Das Gratis-Kontingent gibt es laut Alibaba ausschließlich in Singapur. Für den Selbstbetrieb gilt: Der Ollama-Download von Qwen3.8-27B ist 18 GB groß, plane Grafik- oder Arbeitsspeicher spürbar darüber ein, weil lange Kontexte zusätzlichen Speicher belegen.
Einordnung: Eine Million Input-Tokens plus 200.000 Output-Tokens kosten über Qwen3.8-Flash in Singapur rund 0,24 USD, für die meisten Büroaufgaben ist die API-Rechnung also kein Thema. Auffällig ist der Regionsvergleich: Qwen3.8-Max kostet in Frankfurt im globalen Umfang 1,65 USD statt 2 USD in Singapur, und die Anfragedaten liegen in Deutschland statt in Singapur. EU-Inferenz bekommst du auf keinem der beiden Wege. Wer sie braucht, landet heute bei Qwen3-Max und Qwen3.5-Flash, also bei Qwen3 und Qwen3.5, drei und mehr Generationen hinter Qwen3.8. Selbstbetrieb von Qwen3.8-27B lohnt sich, sobald Datenschutz nicht verhandelbar ist oder das Token-Volumen die API-Rechnung dauerhaft in die Höhe treibt.
Stärken im Detail
Apache 2.0 für das Arbeitspferd. Qwen3.8-27B steht unter einer der liberalsten Lizenzen überhaupt. Keine Schwelle bei Nutzerzahlen, keine Pflicht zur Namensnennung in der Oberfläche, keine Sonderlizenz für Plattformbetreiber. Das unterscheidet das Modell von Llama mit seiner Community License und von den hauseigenen Qwen-Lizenzen für das Flaggschiff. Für Unternehmen, die KI in ein eigenes Produkt einbauen, ist das der unkomplizierteste Rechtsrahmen in der Qwen-Familie.
Eine enorme Modellauswahl. Die Qwen-Organisation auf Hugging Face listet 465 Modelle, von Spezialmodellen wie dem Spracherkennungsmodell Qwen3-ASR-0.6B bis zum Flaggschiff mit 2,4 Billionen Parametern. Du findest dort Sprach-, Bild-, Code- und Audiomodelle aus einer Hand. Allein Qwen3.8-27B kam auf Hugging Face in den letzten 30 Tagen auf über sieben Millionen Downloads (Stand 17. September 2026), entsprechend groß ist die Zahl an Anleitungen, quantisierten Fassungen und Erfahrungsberichten.
Langer Kontext und Multimodalität im Mittelklassemodell. Qwen3.8-27B verarbeitet nativ 262.144 Tokens und lässt sich bis auf eine Million Tokens erweitern. Dazu kommt das Verständnis von Bildern und Videos. Damit liest ein lokal laufendes Modell einen umfangreichen Vertragsordner samt zugehöriger Fotos in einem Durchgang.
Günstige API mit Einstiegskontingent. Qwen3.8-Flash kostet in Singapur 0,15 USD je Million Input-Tokens, und dort gibt es je Modell eine Million Gratis-Tokens, gültig 90 Tage ab Aktivierung von Model Studio, Veröffentlichung des Modells oder Freigabe des Antrags, je nachdem, was später liegt. Für Prototypen und Lastspitzen ist das eine bequeme Ergänzung zum eigenen Server, solange keine personenbezogenen Daten im Spiel sind.
Breite Unterstützung in der Werkzeugkette. Die Modellkarte nennt SGLang und vLLM für den Produktivbetrieb, Ollama bietet das Modell mit Vision-, Tool- und Thinking-Fähigkeit an. Du musst also keine eigene Inferenz-Infrastruktur erfinden, sondern nutzt die Werkzeuge, die ohnehin im Open-Source-Stack stecken.
Schwächen ehrlich betrachtet
Drei Lizenzen in einer Generation. Qwen3.8-27B steht unter Apache 2.0, das Flaggschiff Qwen3.8-2.4T-A95B unter der Qwen3.8-Max License und Qwen3.8-Flash-Next unter der Qwen Community License 1.0. Beide Hauslizenzen verlangen bei mehr als 100 Millionen monatlich aktiven Nutzern oder 20 Millionen USD Monatsumsatz die sichtbare Nennung des Modellnamens in der Oberfläche. Beim Geschäftsmodell unterscheiden sie sich: Wer Model-as-a-Service oder KI-Arbeitsassistenten anbietet, also eigenständige Produkte für Coding oder Office-Arbeit, braucht unter der Qwen3.8-Max License erst dann eine gesonderte Lizenz, wenn der Umsatz samt verbundener Unternehmen in zwölf Monaten 50 Millionen USD übersteigt. Unter der Qwen Community License 1.0 gilt diese Pflicht unabhängig vom Umsatz. Rein interne Nutzung ohne Zugang Dritter ist unter beiden Lizenzen ausgenommen, wer aber einen Coding- oder Office-Assistenten auf Qwen3.8-Flash-Next verkauft, braucht unabhängig von der Firmengröße eine gesonderte Lizenz. Workaround: Bleib bei Qwen3.8-27B, wenn du einen sauberen Rechtsrahmen brauchst.
EU-Inferenz nur für ältere Generationen. In der Model-Studio-Region Frankfurt sind Qwen3.6, Qwen3.7 und Qwen3.8 ausschließlich mit dem Bereitstellungsumfang Global gelistet. Laut Alibaba bestimmt der Umfang den Ort der Inferenz. Alibaba empfiehlt bei Compliance-Anforderungen einen Umfang mit geografischer Grenze und beschreibt Global als größeren Rechenpool. Die Anfragedaten liegen zwar in Frankfurt, gerechnet wird aber womöglich anderswo. Im EU-Umfang stehen nur Modelle wie Qwen3-Max, Qwen-Plus, Qwen3.5-Flash, Qwen3-VL und Qwen3-Coder-Next bereit.
Qwen Studio speichert in Singapur und Festlandchina. Die Chat-Oberfläche unter chat.qwen.ai heißt Qwen Studio. Anbieter ist laut Datenschutzerklärung vom 19. Mai 2026 Alibaba Cloud (Singapore) Private Limited, gespeichert und verarbeitet werden die Daten in Singapur und Festlandchina, und Konzerngesellschaften in beiden Ländern erhalten eingeschränkten Fernzugriff. De-identifizierte Eingaben und Feedback nutzt Alibaba auf Grundlage berechtigter Interessen, um seine KI-Modelle zu trainieren. Bewertest du eine Antwort mit Daumen hoch oder runter, speichert Alibaba das zugehörige Gespräch als Feedback. Übermittlungen aus der EU stützt Alibaba auf Standardvertragsklauseln nach Art. 46 DSGVO. Kundendaten, Personaldaten und Geschäftsgeheimnisse gehören deshalb nicht in Qwen Studio. Workaround: Vertrauliches mit dem selbst betriebenen Qwen3.8-27B bearbeiten oder über die API, deren Daten Alibaba laut eigener Aussage nicht für das Training verwendet.
Das Flaggschiff ist kein Modell für den eigenen Server. Qwen3.8-2.4T-A95B hat 2,4 Billionen Parameter, davon 95 Milliarden pro Token aktiv. Selbst in FP8 bedeutet das rechnerisch Gewichte im Terabyte-Bereich. Die offenen Gewichte sind für Forschungseinrichtungen und große Rechenzentren interessant, für den Mittelstand bleibt die Spitzenleistung ein API-Produkt.
Herkunft und Governance. Alibaba ist ein chinesischer Konzern. In manchen Branchen, bei Behörden und in kritischer Infrastruktur ist die Herkunft eines Modells ein Ausschlusskriterium, unabhängig davon, ob es lokal läuft. Kläre das mit deiner Compliance, bevor du Zeit in eine Evaluierung steckst, und prüfe Antworten zu politisch sensiblen Themen selbst. Die Benchmarkvergleiche mit Modellen von Anthropic und OpenAI auf der Modellkarte von Qwen3.8-2.4T-A95B sind Herstellerangaben, nicht unabhängig bestätigt.
Kein deutschsprachiger Support. Dokumentation, Modellkarten und Lizenzen sind auf Englisch, einen deutschen Ansprechpartner gibt es nicht. Wer Beratung auf Deutsch braucht, holt sie sich über einen Integrator oder greift zu einem europäischen Anbieter.
Alternativen im Vergleich
| Wenn du… | …nimm stattdessen |
|---|---|
| Ein weiteres chinesisches Open-Weight-Modell mit starkem Reasoning vergleichen willst | DeepSeek |
| Einen europäischen Anbieter mit EU-Vertragspartner und offenen Modellen brauchst | Mistral AI |
| Ein Open-Weight-Modell aus den USA mit dem größten westlichen Ökosystem suchst | Llama |
| Qwen-Modelle ohne eigenen Server über eine deutsche Plattform nutzen willst | Lurus |
| Einen gehosteten Assistenten mit ausgereifter Oberfläche für Teams willst | Claude |
Ebenfalls einen Blick wert ist Googles Gemma-Familie für kleinere Open-Weight-Modelle. Im Open-Weight-Lager ist Qwen vor allem dann die erste Wahl, wenn Apache 2.0, Multimodalität und langer Kontext in einem lokal lauffähigen Modell zusammenkommen sollen.
So steigst du ein
Schritt 1: Lokal mit Ollama ausprobieren. Installiere Ollama und lade das Modell mit ollama run qwen3.8:27b. Nimm drei echte Aufgaben aus deinem Alltag, etwa eine E-Mail-Antwort, die Zusammenfassung eines 30-seitigen PDFs und die Auswertung eines Fotos, und vergleiche das Ergebnis mit dem Werkzeug, das du bisher nutzt. So siehst du in einer Stunde, ob die Qualität für deinen Anwendungsfall reicht, ohne dass Daten den Rechner verlassen.
Schritt 2: API bewusst nach Region wählen. Für Experimente mit unkritischen Daten reicht die Region Singapur mit dem Gratis-Kontingent. Für den Produktivbetrieb legst du in Frankfurt einen Workspace mit dem Bereitstellungsumfang EU an und wählst ein Modell, das dort gelistet ist. In Frankfurt gibt es ohnehin nur die Workspace-Domain. Wer in Singapur noch über die DashScope-Domain (dashscope-intl.aliyuncs.com) arbeitet, sollte auf die Workspace-Domain umstellen, die Alibaba für den Produktivbetrieb empfiehlt.
Schritt 3: Lizenz und Denkmodus festlegen. Dokumentiere, welche Modellvariante unter welcher Lizenz läuft, bevor Qwen in ein Produkt wandert. Schalte den Thinking-Modus für einfache Aufgaben wie Klassifizierung oder Extraktion ab, das spart Rechenzeit und Tokens, und reserviere ihn für mehrstufige Aufgaben. Wer mehrere Nutzer bedienen will, wechselt vom Laptop auf vLLM auf einem Server.
Ein konkretes Beispiel
Ein typisches Szenario: Ein Maschinenbauer aus Bielefeld mit 140 Mitarbeitenden will seinen Service-Technikern schneller Antworten aus 2.000 Seiten Wartungshandbüchern, Ersatzteillisten und Fotos von Typenschildern liefern. Eine US-Cloud scheidet aus, weil die Unterlagen Konstruktionsdetails enthalten. Die IT betreibt Qwen3.8-27B unter Apache 2.0 mit vLLM auf einem eigenen GPU-Server im Keller und bindet die Handbücher über eine Dokumentensuche an. Ein Techniker fotografiert das Typenschild einer Anlage, das Modell erkennt den Maschinentyp, sucht die passende Wartungsanleitung und fasst die nötigen Schritte zusammen. Statt 20 bis 30 Minuten Blättern in PDF-Ordnern dauert die Recherche schätzungsweise unter fünf Minuten pro Einsatz. Die Lizenzfrage ist mit Apache 2.0 erledigt, und kein Dokument verlässt das Werk.
Nicht sicher, ob Qwen zu euch passt?
Wir helfen bei der Tool-Auswahl und begleiten die Einführung in euren Arbeitsalltag, unverbindlich und kostenlos im Erstgespräch.
DSGVO & Datenschutz
- Selbstbetrieb: Betreibst du Qwen3.8-27B auf eigener Hardware, fließen keine Daten an Alibaba. Das ist der datenschutzrechtlich sauberste Weg, die Verantwortung für Zugriffsschutz und Protokollierung liegt dann komplett bei dir.
- Model Studio, Speicherort: Laut Alibaba bestimmt die gewählte Region, wo Anfragedaten gespeichert werden. Die Region Frankfurt hält die Daten also in Deutschland, Singapur in einem Drittland.
- Model Studio, Inferenzort: Der Bereitstellungsumfang bestimmt, wo gerechnet wird. Frankfurt bietet Global und EU, die Generationen Qwen3.6, Qwen3.7 und Qwen3.8 aber nur Global. Für personenbezogene Daten wählst du den EU-Umfang und ein dort gelistetes Modell.
- Model Studio, Training: Laut Alibaba werden API-Daten nicht für das Modelltraining verwendet, Model Studio hat ein SOC-2-Testat für Sicherheit, Verfügbarkeit und Vertraulichkeit.
- Qwen Studio (chat.qwen.ai): Anbieter ist Alibaba Cloud (Singapore) Private Limited. Laut Datenschutzerklärung vom 19. Mai 2026 werden die Daten in Singapur und Festlandchina gespeichert und verarbeitet, Konzerngesellschaften dort haben eingeschränkten Fernzugriff. De-identifizierte Eingaben und Feedback fließen auf Grundlage berechtigter Interessen ins Training der KI-Modelle, und eine Bewertung mit Daumen hoch oder runter speichert das zugehörige Gespräch als Feedback. Für Übermittlungen aus der EU nennt Alibaba Standardvertragsklauseln nach Art. 46 DSGVO. Verwende Qwen Studio nicht für personenbezogene oder vertrauliche Daten.
- Auftragsverarbeitung: Ob und in welcher Form Alibaba Cloud einen Auftragsverarbeitungsvertrag nach Art. 28 DSGVO anbietet, konnten wir nicht belegen. Kläre das schriftlich vor dem Produktivstart.
- Empfehlung für Unternehmen: Für sensible Daten Qwen3.8-27B selbst betreiben, für die API nur Frankfurt mit EU-Umfang nutzen und Qwen Studio höchstens für öffentliche Informationen verwenden, weil Eingaben dort ins Training fließen können.
Gut kombiniert mit
- Ollama, der schnellste Weg, Qwen3.8-27B auf einem Laptop oder einer Workstation zu starten. Ein Befehl lädt das Modell, eine lokale Schnittstelle bindet es an eigene Skripte und Oberflächen an.
- LM Studio, die grafische Alternative für alle, die nicht im Terminal arbeiten wollen. Du lädst Qwen-Modelle per Klick, vergleichst Quantisierungen und chattest lokal, ohne eine Zeile Code.
- vLLM, der Inferenz-Server, den die Qwen-Modellkarte für den Produktivbetrieb nennt. Sobald mehrere Mitarbeitende gleichzeitig auf das Modell zugreifen, liefert vLLM den nötigen Durchsatz auf dem eigenen GPU-Server.
Häufige Fragen zu Qwen
Was kostet Qwen?
Die Chat-Oberfläche Qwen Studio (chat.qwen.ai) ist laut Anbieter kostenlos nutzbar, die Modellgewichte ebenfalls. Per API über Alibaba Cloud Model Studio kostet Qwen3.8-Flash in Singapur 0,15 USD Input und 0,47 USD Output je Million Tokens, Qwen3.8-Max 2 USD und 6 USD. In Singapur gibt es je Modell eine Million Gratis-Tokens, gültig für 90 Tage. In Frankfurt kostet Qwen3.8-Max im globalen Umfang 1,65 USD und 4,951 USD.
Darf ich Qwen kommerziell nutzen?
Ja, aber die Lizenz hängt vom Modell ab. Qwen3.8-27B steht unter Apache 2.0 ohne Auflagen zu Nutzerzahlen oder Umsatz. Das Flaggschiff Qwen3.8-2.4T-A95B (Qwen3.8-Max License) und Qwen3.8-Flash-Next (Qwen Community License 1.0) verlangen bei mehr als 100 Millionen monatlich aktiven Nutzern oder 20 Millionen USD Monatsumsatz eine sichtbare Namensnennung. Für Anbieter von Model-as-a-Service oder KI-Arbeitsassistenten für Coding und Office verlangt die Max License eine gesonderte Lizenz erst ab mehr als 50 Millionen USD Umsatz in zwölf Monaten, die Community License unabhängig vom Umsatz. Rein interne Nutzung ohne Zugang Dritter ist bei beiden ausgenommen.
Kann ich Qwen lokal auf meinem Rechner nutzen?
Ja. Qwen3.8-27B gibt es in Ollama als 18-GB-Download mit 256K Kontextfenster, dazu eine MLX-Variante für Apple-Rechner. Plane Grafik- oder Arbeitsspeicher über der Downloadgröße ein. Das Flaggschiff mit 2,4 Billionen Parametern ist für einzelne Rechner nicht gedacht.
Ist Qwen DSGVO-konform?
Das hängt vom Betriebsweg ab. Selbst betrieben bleiben alle Daten im Haus. Über die API speichert die Region Frankfurt die Anfragedaten in Deutschland, EU-Inferenz gibt es dort aber nur für ältere Modelle wie Qwen3-Max und Qwen3.5-Flash, und einen Auftragsverarbeitungsvertrag konnten wir nicht belegen. Qwen Studio speichert Daten in Singapur und Festlandchina und eignet sich nicht für personenbezogene Daten.
Ist Qwen sicher?
Lokal betrieben läuft Qwen3.8-27B vollständig auf deiner eigenen Hardware, Eingaben gehen dabei nicht an Alibaba. Die chinesische Herkunft ist vor allem eine Compliance-Frage, die du vorab klärst, weil manche Branchen und Behörden Modelle chinesischer Anbieter grundsätzlich ausschließen. Antworten zu politisch sensiblen Themen solltest du selbst prüfen.
Unser Fazit
Qwen verdient 4 von 5 Sternen. Mit Qwen3.8-27B liefert Alibaba ein multimodales Modell mit 262.144 Tokens Kontext unter Apache 2.0, das lokal in Ollama läuft und im Unternehmen ohne Lizenzsorgen einsetzbar ist. Dazu kommen eine riesige Modellauswahl und eine API, die mit 0,15 USD je Million Input-Tokens für Qwen3.8-Flash einen günstigen Einstieg bietet. Den fünften Stern kosten die uneinheitlichen Lizenzen innerhalb derselben Generation, die fehlende EU-Inferenz für Qwen3.6 bis Qwen3.8 in Frankfurt und Qwen Studio, das Eingaben in Singapur und Festlandchina speichert. Für Teams mit eigener IT ist Qwen im Selbstbetrieb eine der stärksten offenen Optionen, für die sorglose Cloud-Nutzung mit personenbezogenen Daten ist es das nicht.
Was wir bemerkt haben
- August 2026, Qwen3.8 erschien mit drei offenen Varianten unter drei verschiedenen Lizenzen: Qwen3.8-27B unter Apache 2.0, Qwen3.8-2.4T-A95B unter der Qwen3.8-Max License und Qwen3.8-Flash-Next unter der Qwen Community License 1.0. Wer pauschal von „Qwen ist Apache 2.0“ ausgeht, liegt beim Flaggschiff falsch.
- September 2026, In der Model-Studio-Region Frankfurt sind Qwen3.6, Qwen3.7 und Qwen3.8 nur im Bereitstellungsumfang Global gelistet. Die EU-Variante endet bei Modellen wie Qwen3-Max und Qwen3.5-Flash. Gleichzeitig ist Qwen3.8-Max im globalen Umfang mit 1,65 USD Input günstiger als in Singapur mit 2 USD, das Gratis-Kontingent gibt es aber nur in Singapur.
- September 2026, Für die DashScope-Domain dashscope.aliyuncs.com (Region Peking) kündigt Alibaba an, dass sie nach dem 30. September 2026 keine neuen Funktionen mehr bekommt. Für den Produktivbetrieb empfiehlt Alibaba die Workspace-Domain, in Frankfurt gibt es ohnehin keine DashScope-Domain.
- September 2026, Die Chat-Oberfläche unter chat.qwen.ai heißt Qwen Studio, die Datenschutzerklärung vom 19. Mai 2026 verwendet den Namen bereits. Laut dieser Erklärung speichert Alibaba die Daten in Singapur und Festlandchina.
Quellen
- Hugging Face – Qwen-Organisation. https://huggingface.co/Qwen (abgerufen am 2026-09-17). 465 Modelle und über 104.000 Follower; Qwen3.8-Serie im August 2026 veröffentlicht mit Qwen3.8-2.4T-A95B, Qwen3.8-27B (über 7 Mio. Downloads in den letzten 30 Tagen, Stand 17.09.2026) und Qwen3.8-Flash-Next; darunter die Spracherkennungsmodelle Qwen3-ASR-0.6B und Qwen3-ASR-1.7B..
- Hugging Face – Modellkarte Qwen3.8-27B. https://huggingface.co/Qwen/Qwen3.8-27B (abgerufen am 2026-09-17). Lizenz Apache 2.0, dichtes Modell mit 27 Mrd. Parametern, Kontext nativ 262.144 Tokens und bis 1.000.000 Tokens erweiterbar, versteht Text, Bilder und Videos, Thinking-Modus standardmäßig an und pro Anfrage abschaltbar, Denktiefe über reasoning_effort steuerbar, Bereitstellung mit Transformers, SGLang und vLLM (Beispiele für Videoeingabe mit vLLM), als offiziellen API-Dienst nennt die Modellkarte Qwen Cloud (qwencloud.com), die gehostete Fassung von Qwen3.8-27B dort ist als bald verfügbar angekündigt; über 7 Mio. Downloads in den letzten 30 Tagen, Stand 17.09.2026..
- Hugging Face – Modellkarte Qwen3.8-2.4T-A95B. https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B (abgerufen am 2026-09-17). Lizenz Qwen3.8-Max License, 2,4 Billionen Parameter mit 95 Mrd. aktiven Parametern, 512 Experten, Kontext nativ 262.144 und bis 1.010.000 Tokens erweiterbar, nur Text; Qwen3.8-Max ist die offizielle gehostete Version; Benchmarkvergleich mit Claude Opus 4.8, Claude Fable 5 und GPT-5.6 Sol als Herstellerangabe..
- Qwen – Qwen3.8-Max License. https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/blob/main/LICENSE (abgerufen am 2026-09-17). Kommerzielle Nutzung erlaubt; bei mehr als 100 Mio. monatlich aktiven Nutzern oder 20 Mio. USD Monatsumsatz muss der Modellname sichtbar in der Oberfläche stehen; wer ein Model-as-a-Service-Geschäft oder KI-Arbeitsassistenten (eigenständige Produkte für KI-gestütztes Coding oder Büroarbeit) betreibt, braucht erst bei mehr als 50 Mio. USD Umsatz samt verbundener Unternehmen in zwölf aufeinanderfolgenden Monaten eine gesonderte Lizenz; interne Nutzung ohne Zugang Dritter ist davon ausgenommen..
- Hugging Face – Modellkarte Qwen3.8-Flash-Next. https://huggingface.co/Qwen/Qwen3.8-Flash-Next (abgerufen am 2026-09-17). Lizenz Qwen Community License 1.0, 125 Mrd. Parameter mit 6 Mrd. aktiven Parametern plus Zusatz-Embeddings (180 Mrd. in den Gewichten), Mixture of Experts mit 512 Experten, Kontext nativ 262.144 bis 1.000.000 Tokens, Text, Bild und Video; die Produktivversion Qwen3.8-Flash gibt es nur per API..
- Qwen – Qwen Community License 1.0. https://huggingface.co/Qwen/Qwen3.8-Flash-Next/blob/main/LICENSE (abgerufen am 2026-09-17). Kommerzielle Nutzung erlaubt, keine reine Forschungslizenz; bei mehr als 100 Mio. monatlich aktiven Nutzern oder 20 Mio. USD Monatsumsatz Pflicht zur sichtbaren Nennung des Modellnamens; wer ein Model-as-a-Service-Geschäft oder KI-Arbeitsassistenten (eigenständige Produkte für KI-gestütztes Coding oder Büroarbeit) betreibt, braucht ohne Umsatzschwelle eine gesonderte Lizenz von Qwen; interne Nutzung ohne Zugang Dritter ist davon ausgenommen..
- Alibaba Cloud Model Studio – Preise für Modellinferenz. https://www.alibabacloud.com/help/en/model-studio/model-pricing (abgerufen am 2026-09-17). Singapur (International): qwen3.8-max 2 USD Input und 6 USD Output je 1 Mio. Tokens, qwen3.8-flash 0,15 und 0,47 USD, qwen3.8-27b 0,50 und 3 USD, qwen3.8-2.4t-a95b 2 und 6 USD; Gratis-Kontingent 1 Mio. Tokens nur in Singapur, gültig 90 Tage ab Aktivierung von Model Studio, Veröffentlichung des Modells oder Freigabe des Antrags, je nachdem, was später liegt. Frankfurt: qwen3.8-max 1,65 und 4,951 USD und qwen3.8-flash 0,113 und 0,382 USD nur mit Bereitstellung Global, ebenso alle gelisteten Qwen3.7- und Qwen3.6-Modelle (u. a. qwen3.6-plus, qwen3.6-flash, qwen3.6-35b-a3b); mit Bereitstellung EU u. a. qwen3-max (1,20 und 6 USD bis 32K Input), qwen-plus, qwen3.5-flash (0,10 und 0,40 USD), qwen3-vl-flash, qwen3-vl-plus und qwen3-coder-next. Seite zuletzt aktualisiert am 17.09.2026..
- Alibaba Cloud Model Studio – Regionen und Endpunkte. https://www.alibabacloud.com/help/en/model-studio/regions (abgerufen am 2026-09-17). Die Region bestimmt Zugangspunkt und Speicherort der Anfragedaten, der Bereitstellungsumfang bestimmt den Ort der Inferenz; bei Compliance-Anforderungen empfiehlt Alibaba einen Umfang mit geografischer Grenze, Global beschreibt Alibaba als größeren Rechenpool; Frankfurt unterstützt Global und EU, Singapur nur International; für den Produktivbetrieb empfohlen ist die Workspace-Domain, DashScope-Domains: Peking dashscope.aliyuncs.com, Singapur dashscope-intl.aliyuncs.com, Frankfurt keine; die DashScope-Domain dashscope.aliyuncs.com bekommt nach dem 30. September 2026 keine neuen Funktionen mehr. Seite zuletzt aktualisiert am 17.09.2026..
- Ollama – Modellbibliothek qwen3.8. https://ollama.com/library/qwen3.8 (abgerufen am 2026-09-17). qwen3.8:27b als 18-GB-Download mit 256K Kontextfenster, Eingabetypen nur Text und Bild, zusätzlich qwen3.8:27b-mlx mit denselben Eingabetypen; Fähigkeiten Vision, Tools und Thinking; 2,1 Mio. Downloads..
- Qwen – Datenschutzerklärung von Qwen Studio. https://qwen.ai/privacypolicy (abgerufen am 2026-09-17). Stand 19. Mai 2026; gilt für Qwen Studio und weitere Dienste unter qwen.ai, Anbieter ist Alibaba Cloud (Singapore) Private Limited; personenbezogene Daten werden in Singapur und Festlandchina gespeichert oder verarbeitet, Konzerngesellschaften in Singapur und Festlandchina erhalten eingeschränkten Fernzugriff; zum Training und zur Verbesserung der Dienste einschließlich der KI-Modelle werden de-identifizierte Nutzerinhalte und Feedback auf Grundlage berechtigter Interessen verwendet; eine Bewertung mit Daumen hoch oder runter speichert das zugehörige Gespräch als Feedback; Übermittlungen aus der EU stützen sich auf Angemessenheitsbeschlüsse oder Standardvertragsklauseln nach Art. 46 DSGVO..
- Alibaba Cloud Model Studio – Sicherheitszertifizierungen und Datenschutz. https://www.alibabacloud.com/help/en/model-studio/privacy-notice (abgerufen am 2026-09-17). Stand 26. August 2026; Alibaba Cloud verwendet die Daten von Model-Studio-Kunden laut eigener Aussage nie für das Modelltraining; Model Studio hat ein SOC-2-Testat ohne Einschränkung für Sicherheit, Verfügbarkeit und Vertraulichkeit; bei Anwendungsaufbau und Modelltraining übertragene Daten sind mit AES-256 verschlüsselt..
- Qwen – Startseite. https://qwen.ai/home (abgerufen am 2026-09-17). Qwen Studio ist laut Anbieter kostenlos nutzbar und offen für alle; der Seitenfuß nennt Qwen Cloud als API-Plattform..
- Qwen Cloud – Startseite. https://www.qwencloud.com/ (abgerufen am 2026-09-17). Betreiber Intelligent Cloud Computing (Singapore) Private Limited; Qwen3.8-Max 2 USD Input und 6 USD Output je 1 Mio. Tokens, Qwen3.8-Flash 0,15 und 0,47 USD; Token Plan für Einzelnutzer ab 6 USD im Monat; Speicherort und Datenschutzbedingungen nennt die Startseite nicht..
- Qwen Studio. https://chat.qwen.ai/ (abgerufen am 2026-09-17). Die Chat-Oberfläche unter chat.qwen.ai trägt den Namen Qwen Studio..
Diesen Inhalt teilen:
Arthur Atlas
KI-Analyst
So entsteht diese Bewertung
Diese Seite bewerten wir redaktionell, mit kräftiger Unterstützung von Arthur Atlas, unserem KI-Analysten. Er prüft Bewertungen nach und markiert veraltete Angaben, sobald sich der Markt dreht. Unsere Angaben stammen überwiegend aus öffentlich zugänglichen Quellen wie Anbieter-Website, Doku und Preislisten. Preise und Funktionen können sich ändern.
Hinweis: Diese Angaben können veraltet oder fehlerhaft sein. Prüfe im Zweifel immer direkt auf der Website des Anbieters.
Preise geändert, Feature veraltet oder etwas fehlt?
Wir freuen uns über Hinweise und Ergänzungen.
Du arbeitest bei Alibaba Cloud (Qwen-Team)?
Gib uns einen Testzugang, dann schauen wir tiefer rein und ergänzen die Bewertung aus erster Hand.
KI-Tools und Trends
KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools
Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.