Das Wichtigste in Kürze
- Open-Source-LLMs im Unternehmen sind 2026 produktionsreif für Klassifikation, Extraktion, Suche, Zusammenfassungen und viele Chat-Aufgaben. Bei autonomen Agenten, Werkzeugnutzung und Multimodalität liegen die proprietären Spitzenmodelle weiter vorn.
- Lizenz vor Technik prüfen: Mistral Large 3 und gpt-oss stehen unter Apache 2.0, DeepSeek V4 unter MIT. Die multimodalen Llama-4-Modelle sind für Unternehmen mit Hauptsitz in der EU laut Meta-Nutzungsrichtlinie ausgenommen.
- Self-Hosting ist eine Betriebsverpflichtung, kein Sparmodell. Rechnen Sie mit GPU-Kapazität rund um die Uhr, fester Betriebskapazität und einem Prüflauf bei jedem Modellwechsel. Für die meisten Mittelständler ist eine europäische Managed-API der wirtschaftlichere Einstieg.
- Preisverfall spricht gegen frühe Festlegung: Die a16z-Analyse „LLMflation" (November 2024) misst für gleiche Modellqualität einen Preisrückgang der Inferenz um rund den Faktor zehn pro Jahr.
- Offene Modelle sind regulatorisch bevorzugt, nicht freigestellt. Art. 53 Abs. 2 der KI-Verordnung entlastet Anbieter offener Modelle teilweise. Wer ein Modell einsetzt, bleibt für den eigenen Einsatz verantwortlich. Stand: September 2026.
Vor zwei Jahren hieß KI im Mittelstand praktisch immer: ein Vertrag mit einem großen US-Anbieter. 2026 ist daraus eine echte Auswahl geworden. Mistral hat im Dezember 2025 mit Mistral Large 3 ein Flaggschiff unter Apache 2.0 veröffentlicht, OpenAI mit gpt-oss erstmals seit GPT-2 wieder offene Gewichte, DeepSeek liefert V4 mit einer Million Token Kontext unter MIT-Lizenz, und das Schweizer Apertus-Modell zeigt, dass ein vollständig offengelegtes europäisches Modell technisch machbar ist.
Damit wird aus einer IT-Frage eine Architekturentscheidung: Welche Aufgaben laufen über offene Modelle, welche über proprietäre Modelle, und wo laufen sie? Dieser Leitfaden beantwortet das mit geprüften Modellständen, einer ehrlichen Wirtschaftlichkeitsbetrachtung und einer Hybridstrategie, die im Mittelstand tatsächlich funktioniert.
Was heißt „Open Source" bei Sprachmodellen wirklich?
Der Begriff ist unscharf geworden: Er reicht von „Gewichte herunterladbar, kommerzielle Nutzung eingeschränkt" bis zu „Gewichte, Trainingscode und Daten offengelegt". Für eine belastbare Entscheidung genügt es, drei Kategorien zu unterscheiden.
Open-Source-Modelle
Gewichte, Trainingsrezepte und Datenbeschreibung sind dokumentiert, die Lizenz ist permissiv. Beispiel: Apertus von EPFL und ETH Zürich. Auditierbar und reproduzierbar.
Open-Weight-Modelle
Gewichte sind frei verfügbar, meist unter Apache 2.0 oder MIT, Trainingsdaten und Code aber nicht. Beispiele: Mistral Large 3, DeepSeek V4, gpt-oss. Voll nutzbar, nicht reproduzierbar.
Offene Gewichte mit Auflagen
Herunterladbar, aber mit Nutzungsbeschränkung, Regionsausschluss oder Umsatzschwelle. Beispiele: Llama 4, einzelne Modelle mit eigener Anbieterlizenz. Lizenztext zwingend prüfen.
Die Open Source Initiative hat mit ihrer Definition offener KI 2024 versucht, den Begriff zu schärfen: Erst Gewichte, Code und eine Beschreibung der Trainingsdaten zusammen ergeben Open Source. Nach diesem Maßstab sind viele kommerziell genutzte Modelle eben keine Open-Source-Modelle. Für die Praxis ist das weniger ein Namensstreit als eine Compliance-Frage: Je weniger offengelegt ist, desto mehr Restrisiko bleibt bei Ihnen.
Welche offenen Modelle sind 2026 produktionsreif?
Produktionsreif sind 2026 vor allem Mistral Large 3 und Medium 3.5, DeepSeek V4, gpt-oss und Apertus, jeweils mit unterschiedlichen Lizenzen. Die Übersicht zeigt Lizenz und EU-Eignung nach den Modellkarten der Anbieter, Stand September 2026.
Modellstände ändern sich schnell: Prüfen Sie Lizenz und Version vor jeder Festlegung erneut.
| Modell | Veröffentlicht | Architektur | Kontext | Lizenz | Für EU-Unternehmen nutzbar |
|---|---|---|---|---|---|
| Mistral Large 3 | 12/2025 | 675 Mrd. Parameter, 41 Mrd. aktiv, multimodal | rund 290k | Apache 2.0 | Ja |
| Mistral Medium 3.5 | 04/2026 | 128 Mrd. Parameter, dense, multimodal | 256k | modifizierte MIT-Lizenz mit Umsatzschwelle | Ja, Lizenz je Umsatz prüfen |
| Ministral 3 (3B bis 14B) | 12/2025 | dense, multimodal, für kleine Umgebungen | bis 256k | Apache 2.0 | Ja |
| DeepSeek V4-Pro | 04/2026 | 1,6 Bio. Parameter, 49 Mrd. aktiv | 1 Mio. | MIT | Ja, siehe Hinweis unten |
| DeepSeek V4-Flash | 04/2026 | 284 Mrd. Parameter, 13 Mrd. aktiv | 1 Mio. | MIT | Ja, siehe Hinweis unten |
| gpt-oss-120b | 08/2025 | 117 Mrd. Parameter, 5,1 Mrd. aktiv, läuft auf einer 80-GB-GPU | 131k | Apache 2.0 | Ja |
| Apertus 8B und 70B | 09/2025 | dense, 1.811 Sprachen, Daten und Rezepte offengelegt | 65k | Apache 2.0 | Ja |
| Llama 4 Scout und Maverick | 04/2025 | Mixture-of-Experts, multimodal | bis 10 Mio. | Llama Community License | Nein, EU-Ausschluss für die multimodalen Modelle |
Quellen: Modellkarten der Anbieter auf Hugging Face sowie die jeweiligen Ankündigungen, abgerufen im September 2026. Daneben erscheinen laufend weitere offene Modellfamilien, etwa Qwen, Kimi und GLM. Deren Lizenzen unterscheiden sich je Variante und gehören vor jedem Einsatz auf den Tisch.
Llama 4 in der EU: der Lizenzausschluss
Die Nutzungsrichtlinie zu Llama 4 hält fest: „With respect to any multimodal models included in Llama 4, the rights granted under Section 1(a) of the Llama 4 Community License Agreement are not being granted to you if you are an individual domiciled in, or a company with a principal place of business in, the European Union." Ausgenommen sind ausdrücklich Endnutzer eines Produkts, das solche Modelle enthält. Für ein deutsches Unternehmen heißt das: Ein Produkt eines Dritten auf Llama-4-Basis dürfen Sie nutzen, die multimodalen Modelle selbst in den eigenen Stack einbauen nicht. Eine Konzerngesellschaft außerhalb der EU darf die multimodalen Modelle laut Meta-FAQ zwar nutzen, europäische Konzerngesellschaften dürfen an Entwicklung und Vertrieb aber nicht beteiligt sein. Diese Konstruktion ist eng gefasst und gehört in die Rechtsprüfung, nicht in die Architekturskizze. Quellen: Llama 4 Acceptable Use Policy und Meta-FAQ, abgerufen im September 2026.
Wo stehen offene Modelle im Vergleich zu den Spitzenmodellen?
Kurz gesagt: Bei klar umrissenen Aufgaben ist der Abstand praktisch verschwunden, bei offenen, mehrstufigen Aufgaben besteht er weiter. Vier Beobachtungen aus Modellkarten und Benchmarks:
- Schlussfolgern ist weitgehend eingeholt. OpenAI gibt in der Modellkarte zu gpt-oss-120b an, dass das Modell bei Kern-Reasoning-Benchmarks nahe an o4-mini herankommt, und das bei einem Speicherbedarf, der auf eine einzelne 80-GB-GPU passt.
- Programmieren: die Spitze liegt vorn, der Abstand ist messbar klein. Mistral gibt für Medium 3.5 in der Modellkarte 77,6 Prozent auf SWE-bench Verified an. Die proprietären Spitzenmodelle liegen darüber, für Standardaufgaben in der Entwicklung reicht der offene Stand aber aus.
- Lange Kontexte sind kein Alleinstellungsmerkmal mehr. DeepSeek V4 bietet eine Million Token unter MIT-Lizenz. Entscheidend ist ohnehin nicht die Länge, sondern die Trefferqualität über lange Dokumente hinweg.
- Multimodalität und Werkzeugnutzung: proprietär vorn. Bei Bildverständnis mit anschließendem Schlussfolgern, bei Browser- und Rechnerzugriff und bei agentischen Abläufen mit vielen Schritten ist die Reife der großen Anbieter weiterhin höher.
Wo offene Modelle heute produktiv reichen
- Klassifikation, Extraktion, Weiterleitung
- Einbettungen und semantische Suche
- Antworten auf eigenen Wissensbasen
- Standardisierte Chat- und Frage-Antwort-Abläufe
- Code-Vervollständigung
- Zusammenfassungen und Langtextanalysen
Wo proprietäre Spitzenmodelle vorn liegen
- Autonome Abläufe mit vielen Werkzeugaufrufen
- Entwicklungsaufgaben über ganze Projekte hinweg
- Bildverständnis mit anschließendem Schlussfolgern
- Rechner- und Browsersteuerung
- Hohe Trefferqualität in sehr langen Kontexten
- Mehrstufiges Reasoning
Welche Hosting-Wege gibt es für offene Modelle?
Drei Wege sind praktisch relevant, und sie unterscheiden sich weniger in der Modellqualität als im Betriebsaufwand und im Compliance-Profil.
Drei Wege zum offenen Modell
| Weg | Was es ist | Wann sinnvoll | Typische Anbieter |
|---|---|---|---|
| A. Managed-API | Offene Modelle als Programmierschnittstelle bei einem spezialisierten Anbieter | Schneller Einstieg, kleine bis mittlere Mengen, kein eigener Modellbetrieb | In Europa unter anderem IONOS AI Model Hub, OVHcloud AI Endpoints, STACKIT AI Model Serving |
| B. Souveräne EU-Infrastruktur | Offene Modelle auf dedizierter GPU-Infrastruktur in Europa | Regulierte Bereiche, hohe Anforderungen an Betrieb und Nachweis | Industrial AI Cloud von Telekom und NVIDIA, STACKIT, AWS European Sovereign Cloud, SAP mit Mistral |
| C. Eigener Betrieb | Eigene GPUs, eigener Inferenz-Stack, etwa vLLM oder NVIDIA NIM | Abgeschottete Netze, sehr hohe gleichmäßige Last, Spezialmodelle | Eigenes Rechenzentrum oder Colocation |
Weg A ist im Mittelstand der pragmatische Start. Die europäischen Anbieter machen dabei konkrete Zusagen: STACKIT nennt die Region Germany South und hält fest, dass Daten und Abfragen weder gespeichert noch zum Training verwendet werden.
OVHcloud wirbt mit „Zero Data Retention" und schließt die Nutzung der Daten zum Modelltraining aus. IONOS betreibt den AI Model Hub in deutschen Rechenzentren. Prüfen Sie die Zusagen im Vertrag, nicht auf der Produktseite.
Weg B ist 2026 erstmals breit verfügbar. Die Industrial AI Cloud von Telekom und NVIDIA läuft seit dem 4. Februar 2026 in München mit knapp 10.000 Blackwell-GPUs und bis zu 0,5 ExaFLOPS; als Partner nennt die Telekom unter anderem Siemens, SAP, Agile Robots und PhysicsX.
Die AWS European Sovereign Cloud ist seit dem 14. Januar 2026 in Brandenburg allgemein verfügbar, wird von in der EU ansässigem Personal betrieben und ist mit 7,8 Milliarden Euro hinterlegt.
Dazu kommt die Allianz von SAP und Mistral vom 18. November 2025, die Mistral-Modelle in die SAP-Plattform bringt.
Weg C ist für die meisten Mittelständler eine Falle. Er verlangt GPU-Kapazität rund um die Uhr, Überwachung, Prüfdatensätze, Sicherheitsprüfungen und einen erneuten Abgleich bei jedem Modellwechsel. Nach unserer Erfahrung aus Mittelstandsprojekten rechnet sich der eigene Betrieb gegenüber einer europäischen Managed-API erst bei sehr hohen, gleichmäßigen Mengen, und auch dann erst mit fest eingeplanter Betriebsmannschaft. Diese Schwelle ist eine Erfahrungsschätzung, keine belegte Kennzahl.
Wann rechnet sich Self-Hosting?
Die Antwort hängt an drei Größen: Menge, Sensibilität und vorhandene Betriebskapazität. Drei Konstellationen, die in der Praxis wiederkehren:
- Mittelständler mit 100 bis 500 Beschäftigten, Chat und Wissenssuche. Sinnvoll ist eine europäische Managed-API für die einfacheren Aufgaben, kombiniert mit einem proprietären Spitzenmodell für den anspruchsvollen Rest. Eigener Modellbetrieb lohnt sich hier in aller Regel nicht.
- Industrieunternehmen mit regulierten Daten. Wissensbasen aus der Entwicklung, Serviceautomatisierung, technischer Vertrieb. Sinnvoll ist eine souveräne EU-Infrastruktur für die regulierten Pfade und ein zusätzlicher Zugang zu Spitzenmodellen für alles andere.
- Abgeschottete Umgebungen, Behörden, Verteidigung. Hier führt kein Weg am eigenen Betrieb vorbei. Der Aufwand ist hoch, aber alternativlos.
Zwei Kostenposten werden in Eigenbetriebs-Rechnungen fast immer unterschätzt. Erstens das Personal: Ohne feste Kapazität für Betrieb, Bereitschaft und Modellpflege ist produktives Self-Hosting riskant. Zweitens der Leerlauf: Eine GPU-Instanz kostet auch dann, wenn niemand fragt. Wie Sie beides sauber gegenrechnen, steht im Artikel zu FinOps für KI.
Was sagt die KI-Verordnung zu offenen Modellen?
Offene Modelle sind teilweise entlastet, aber nicht freigestellt, und die Entlastung betrifft die Anbieter der Modelle, nicht deren Anwender.
Art. 53 Abs. 2 der KI-Verordnung nimmt Anbieter von Modellen, deren Parameter und Nutzungsinformationen unter einer freien und quelloffenen Lizenz veröffentlicht sind, von Teilen der Dokumentationspflichten aus. Die Ausnahme entfällt, sobald ein Modell als Modell mit systemischem Risiko eingestuft wird. Die Pflicht zu einer Urheberrechts-Policy und zu einer Zusammenfassung der Trainingsdaten bleibt auch für offene Modelle bestehen.
Für Unternehmen, die ein offenes Modell einsetzen, gilt die Betreiberperspektive: KI-Kompetenz nach Art. 4, Transparenz nach Art. 50 dort, wo Menschen mit dem System interagieren oder Inhalte erzeugt werden, und die Hochrisiko-Regeln, wo sie einschlägig sind. Ein internes Verzeichnis der eigenen KI-Anwendungen ist dafür gute Praxis und erleichtert jede spätere Prüfung, auch wenn es als solches nicht vorgeschrieben ist.
In Deutschland ist die Bundesnetzagentur als zentrale Aufsicht für die Marktüberwachung benannt und betreibt dafür einen KI-Service-Desk. Wer 2026 eine Plattform aufsetzt, sollte die eigenen Anwendungsfälle einordnen, bevor Fristen relevant werden.
Welche Regeln in welcher Reihenfolge greifen, ordnet der Compliance-Leitfaden zu DSGVO und KI-Verordnung ein. Konkrete Transparenzpflichten behandelt der Artikel zu Artikel 50. Diese Einordnung ersetzt keine Rechtsberatung.
Der Sonderfall DeepSeek: Gewichte ja, App nein
DeepSeek ist technisch eines der stärksten offenen Modelle und gleichzeitig datenschutzrechtlich umstritten. Die Unterscheidung, auf die es ankommt: Es geht um den Dienst des Anbieters, nicht um die Gewichte.
Die Berliner Beauftragte für Datenschutz und Informationsfreiheit hat die DeepSeek-Apps am 27. Juni 2025 gemeinsam mit den Aufsichtsbehörden aus Baden-Württemberg, Rheinland-Pfalz und Bremen nach Art. 16 des Digital Services Act bei Apple und Google als rechtswidrigen Inhalt gemeldet. Begründung: Personenbezogene Daten werden an chinesische Auftragsverarbeiter übermittelt, ohne dass die Anforderungen an Drittlandübermittlungen erfüllt sind.
Wer die V4-Gewichte unter MIT-Lizenz herunterlädt und auf europäischer Infrastruktur betreibt, löst genau dieses Problem strukturell: Es findet keine Übermittlung an den Anbieter statt. Zwei Restrisiken bleiben und gehören dokumentiert. Erstens die allgemeinen Sicherheitsfragen zu Modellen, deren Trainingsdaten nicht offengelegt sind. Zweitens die politische Dimension: In sicherheitsrelevanten Branchen fällt die eigene Risikoabwägung häufig zugunsten europäischer oder US-amerikanischer offener Modelle aus.
Die Hybridstrategie: vier Muster, die funktionieren
Die produktivste Architektur 2026 ist weder rein offen noch rein proprietär, sondern eine bewusste Aufteilung nach Menge, Sensibilität und Wert je Anfrage. Vier Muster haben sich bewährt:
- Suche offen, Antwort proprietär. Einbettungen und Suche laufen auf offenen Modellen, die finale Antwort erzeugt ein Spitzenmodell. Das senkt die Kosten der Hochvolumen-Schritte, ohne die Antwortqualität anzutasten.
- Nach Komplexität steuern. Einfache Klassifikation auf einem kleinen offenen Modell, komplexe Synthese auf einem Spitzenmodell. Voraussetzung ist ein Prüfdatensatz, der die Zuordnung belegt, statt sie zu behaupten. Hintergründe im Multi-Modell-Leitfaden.
- Eine Plattform, mehrere Anbieter. Offene und proprietäre Modelle laufen über dieselbe Oberfläche, dieselben Rechte und dieselben Protokolle. Ohne diese Klammer entstehen genau die Insellösungen, die später niemand auditieren kann.
- Abgeschottet für den harten Kern. Konstruktionsdaten, Rezepturen oder Quelltexte aus Auftragsentwicklung laufen auf einem selbst betriebenen offenen Modell, alles andere im normalen Betrieb.
Vier Fehler, die immer wieder vorkommen
Die meisten Fehlentscheidungen bei offenen Modellen entstehen nicht in der Technik, sondern bei Lizenz, Datenfluss und Betrieb. Diese vier Muster begegnen uns in Projekten regelmäßig.
Llama 4 als Standardwahl einplanen
Wenn in einem Architekturvorschlag Llama 4 auftaucht, fragen Sie nach der Lizenzprüfung. Für Unternehmen mit Hauptsitz in der EU sind die multimodalen Modelle ausgenommen.
Den Dienst mit dem Modell verwechseln
Offene Gewichte selbst betreiben und den Cloud-Dienst desselben Anbieters nutzen sind zwei völlig verschiedene Datenflüsse mit völlig verschiedenen Rechtsfolgen.
Self-Hosting ohne feste Betriebskapazität
Modellbetrieb nebenbei führt zu stillen Ausfällen und veralteten Ständen. Ohne eingeplante Kapazität für Betrieb und Modellpflege gehört der eigene Betrieb nicht in den Plan.
Offen mit datenschutzkonform gleichsetzen
Offene Gewichte erfüllen keine einzige Anforderung der DSGVO von selbst. Erst Hosting, Auftragsverarbeitungsvertrag, Rechte, Protokollierung und Löschkonzept ergeben einen belastbaren Stack.
In drei Schritten zur belastbaren Entscheidung
Eine belastbare Entscheidung für oder gegen offene Modelle stützt sich auf eigene Messdaten statt auf Ranglisten. Drei Phasen über etwa ein Quartal reichen dafür in der Regel aus.
-
1
Bestand aufnehmen
Woche 1 bis 4Die fünf wichtigsten Anwendungsfälle mit Mengengerüst, Datenklasse und Qualitätsanspruch beschreiben. Dazu die heutige Modellrechnung als Ausgangswert festhalten.
-
2
Gegen offene Modelle messen
Woche 5 bis 8Je Anwendungsfall einen Prüfdatensatz mit echten Anfragen bauen und offene Modelle über eine europäische Managed-API gegen den heutigen Stand testen. Qualitätsabstand und Kosten je 1.000 Anfragen dokumentieren.
-
3
Hybrid produktiv setzen
Woche 9 bis 12Pro Anwendungsfall das wirtschaftlichste Modell mit ausreichender Qualität festlegen, alles über eine Plattform mit einheitlichen Rechten und Protokollen betreiben und einen festen Termin für die Neubewertung einplanen.
Wie Sie die Qualität dabei sauber messen, statt sie zu schätzen, beschreibt der Artikel zu Evaluation und Beobachtbarkeit.
Wie Plotdesk offene und proprietäre Modelle zusammenbringt
Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand und bringt offene und proprietäre Modelle in einer Plattform zusammen. Über den Model Garden stehen mehr als 100 Modellvarianten aus zehn Provider-Typen zur Verfügung, darunter offene Modelle wie Mistral, gpt-oss oder DeepSeek, wahlweise über EU-Inferenz oder selbst betrieben über OpenAI-kompatible Endpunkte wie vLLM, sowie die proprietären Spitzenmodelle.
Welche Modelle ein Team nutzen darf, wird pro Team, Gruppe und Anwendung freigegeben.
Der Betrieb ist dediziert je Kunde: als Plotdesk Cloud, von Plotdesk betrieben und in der EU gehostet, als Private Cloud oder im eigenen Tenant, zum Beispiel in Azure. Dazu kommen ein DSGVO-konformer Auftragsverarbeitungsvertrag mit EU-Datenresidenz, Single Sign-On, Rollen und mehr als 40 Berechtigungen sowie Audit-Logs. Nutzungs- und Kostenanalysen je Team und Bereich zeigen, wohin die Mengen laufen. Das ist die Grundlage sowohl für Ihr internes KI-Verzeichnis als auch für die Kostensteuerung.
Bestehende Systeme bleiben, wo sie sind: ERP, Fileserver, Ticket-System oder ältere Datenbanken werden über Plotdesk Connect angebunden. Und weil Modellschicht und Plattformschicht getrennt sind, ist ein Wechsel des Modells oder des Hosting-Wegs kein Migrationsprojekt. Wie sich das in gewachsene Landschaften einfügt, zeigt der Leitfaden zur Integration bestehender Systeme.
Häufige Fragen zu Open-Source-LLMs
Sind Open-Source-LLMs automatisch DSGVO-konform?
Darf ein deutsches Unternehmen Llama 4 einsetzen?
Was kostet der eigene Betrieb eines offenen Modells?
Kann ich DeepSeek in Deutschland einsetzen?
Wie stark ist der Qualitätsabstand zu GPT und Claude?
Brauche ich für offene Modelle eigene GPUs?
Fazit: Option, nicht Glaubensfrage
Offene Sprachmodelle sind 2026 eine ernsthafte Option für den Mittelstand, aber keine pauschal bessere Wahl. Den Ausschlag geben Lizenz, Datenklasse und Betriebskapazität.
Wer offene Modelle einsetzt, weil sie gerade gut klingen, baut sich Betriebsaufwand auf. Wer sie ignoriert, verschenkt Spielraum bei Kosten, Datenkontrolle und Unabhängigkeit von einzelnen Anbietern.
Drei Dinge nehmen Sie mit: Die Lizenz entscheidet vor der Technik, besonders bei Llama 4. Die Hybridarchitektur ist die produktive Antwort, nicht die Grundsatzentscheidung. Und Self-Hosting ist eine Betriebsverpflichtung, die sich nur bei klarem Anlass lohnt.
Wer entlang dieser drei Punkte entscheidet, kommt zu einer Architektur, die Modellwechsel übersteht, statt bei jedem neuen Modell erneut zur Debatte zu stehen. Die strategische Einordnung liefert der Leitfaden zu souveräner KI im Mittelstand.