Technologie

Open-Source-LLMs im Unternehmen: Wann sich Self-Hosting lohnt

Mistral, DeepSeek, gpt-oss und Apertus machen offene Modelle zur ernsthaften Option. Welche Lizenzen für EU-Unternehmen gelten, wo offene Modelle mithalten und wann Self-Hosting wirklich die bessere Wahl ist.

Niklas Coors
Niklas Coors Geschäftsführer, Plotdesk
Veröffentlicht
Lesezeit
16 Min.
Open-Source-LLMs im Unternehmen: Wann sich Self-Hosting lohnt

Das Wichtigste in Kürze

  • Open-Source-LLMs im Unternehmen sind 2026 produktionsreif für Klassifikation, Extraktion, Suche, Zusammenfassungen und viele Chat-Aufgaben. Bei autonomen Agenten, Werkzeugnutzung und Multimodalität liegen die proprietären Spitzenmodelle weiter vorn.
  • Lizenz vor Technik prüfen: Mistral Large 3 und gpt-oss stehen unter Apache 2.0, DeepSeek V4 unter MIT. Die multimodalen Llama-4-Modelle sind für Unternehmen mit Hauptsitz in der EU laut Meta-Nutzungsrichtlinie ausgenommen.
  • Self-Hosting ist eine Betriebsverpflichtung, kein Sparmodell. Rechnen Sie mit GPU-Kapazität rund um die Uhr, fester Betriebskapazität und einem Prüflauf bei jedem Modellwechsel. Für die meisten Mittelständler ist eine europäische Managed-API der wirtschaftlichere Einstieg.
  • Preisverfall spricht gegen frühe Festlegung: Die a16z-Analyse „LLMflation" (November 2024) misst für gleiche Modellqualität einen Preisrückgang der Inferenz um rund den Faktor zehn pro Jahr.
  • Offene Modelle sind regulatorisch bevorzugt, nicht freigestellt. Art. 53 Abs. 2 der KI-Verordnung entlastet Anbieter offener Modelle teilweise. Wer ein Modell einsetzt, bleibt für den eigenen Einsatz verantwortlich. Stand: September 2026.

Vor zwei Jahren hieß KI im Mittelstand praktisch immer: ein Vertrag mit einem großen US-Anbieter. 2026 ist daraus eine echte Auswahl geworden. Mistral hat im Dezember 2025 mit Mistral Large 3 ein Flaggschiff unter Apache 2.0 veröffentlicht, OpenAI mit gpt-oss erstmals seit GPT-2 wieder offene Gewichte, DeepSeek liefert V4 mit einer Million Token Kontext unter MIT-Lizenz, und das Schweizer Apertus-Modell zeigt, dass ein vollständig offengelegtes europäisches Modell technisch machbar ist.

Damit wird aus einer IT-Frage eine Architekturentscheidung: Welche Aufgaben laufen über offene Modelle, welche über proprietäre Modelle, und wo laufen sie? Dieser Leitfaden beantwortet das mit geprüften Modellständen, einer ehrlichen Wirtschaftlichkeitsbetrachtung und einer Hybridstrategie, die im Mittelstand tatsächlich funktioniert.

Was heißt „Open Source" bei Sprachmodellen wirklich?

Der Begriff ist unscharf geworden: Er reicht von „Gewichte herunterladbar, kommerzielle Nutzung eingeschränkt" bis zu „Gewichte, Trainingscode und Daten offengelegt". Für eine belastbare Entscheidung genügt es, drei Kategorien zu unterscheiden.

Vollständig offen

Open-Source-Modelle

Gewichte, Trainingsrezepte und Datenbeschreibung sind dokumentiert, die Lizenz ist permissiv. Beispiel: Apertus von EPFL und ETH Zürich. Auditierbar und reproduzierbar.

Häufigster Fall

Open-Weight-Modelle

Gewichte sind frei verfügbar, meist unter Apache 2.0 oder MIT, Trainingsdaten und Code aber nicht. Beispiele: Mistral Large 3, DeepSeek V4, gpt-oss. Voll nutzbar, nicht reproduzierbar.

Vorsicht

Offene Gewichte mit Auflagen

Herunterladbar, aber mit Nutzungsbeschränkung, Regionsausschluss oder Umsatzschwelle. Beispiele: Llama 4, einzelne Modelle mit eigener Anbieterlizenz. Lizenztext zwingend prüfen.

Die Open Source Initiative hat mit ihrer Definition offener KI 2024 versucht, den Begriff zu schärfen: Erst Gewichte, Code und eine Beschreibung der Trainingsdaten zusammen ergeben Open Source. Nach diesem Maßstab sind viele kommerziell genutzte Modelle eben keine Open-Source-Modelle. Für die Praxis ist das weniger ein Namensstreit als eine Compliance-Frage: Je weniger offengelegt ist, desto mehr Restrisiko bleibt bei Ihnen.

Welche offenen Modelle sind 2026 produktionsreif?

Produktionsreif sind 2026 vor allem Mistral Large 3 und Medium 3.5, DeepSeek V4, gpt-oss und Apertus, jeweils mit unterschiedlichen Lizenzen. Die Übersicht zeigt Lizenz und EU-Eignung nach den Modellkarten der Anbieter, Stand September 2026.

Modellstände ändern sich schnell: Prüfen Sie Lizenz und Version vor jeder Festlegung erneut.

Modell Veröffentlicht Architektur Kontext Lizenz Für EU-Unternehmen nutzbar
Mistral Large 312/2025675 Mrd. Parameter, 41 Mrd. aktiv, multimodalrund 290kApache 2.0Ja
Mistral Medium 3.504/2026128 Mrd. Parameter, dense, multimodal256kmodifizierte MIT-Lizenz mit UmsatzschwelleJa, Lizenz je Umsatz prüfen
Ministral 3 (3B bis 14B)12/2025dense, multimodal, für kleine Umgebungenbis 256kApache 2.0Ja
DeepSeek V4-Pro04/20261,6 Bio. Parameter, 49 Mrd. aktiv1 Mio.MITJa, siehe Hinweis unten
DeepSeek V4-Flash04/2026284 Mrd. Parameter, 13 Mrd. aktiv1 Mio.MITJa, siehe Hinweis unten
gpt-oss-120b08/2025117 Mrd. Parameter, 5,1 Mrd. aktiv, läuft auf einer 80-GB-GPU131kApache 2.0Ja
Apertus 8B und 70B09/2025dense, 1.811 Sprachen, Daten und Rezepte offengelegt65kApache 2.0Ja
Llama 4 Scout und Maverick04/2025Mixture-of-Experts, multimodalbis 10 Mio.Llama Community LicenseNein, EU-Ausschluss für die multimodalen Modelle

Quellen: Modellkarten der Anbieter auf Hugging Face sowie die jeweiligen Ankündigungen, abgerufen im September 2026. Daneben erscheinen laufend weitere offene Modellfamilien, etwa Qwen, Kimi und GLM. Deren Lizenzen unterscheiden sich je Variante und gehören vor jedem Einsatz auf den Tisch.

Llama 4 in der EU: der Lizenzausschluss

Die Nutzungsrichtlinie zu Llama 4 hält fest: „With respect to any multimodal models included in Llama 4, the rights granted under Section 1(a) of the Llama 4 Community License Agreement are not being granted to you if you are an individual domiciled in, or a company with a principal place of business in, the European Union." Ausgenommen sind ausdrücklich Endnutzer eines Produkts, das solche Modelle enthält. Für ein deutsches Unternehmen heißt das: Ein Produkt eines Dritten auf Llama-4-Basis dürfen Sie nutzen, die multimodalen Modelle selbst in den eigenen Stack einbauen nicht. Eine Konzerngesellschaft außerhalb der EU darf die multimodalen Modelle laut Meta-FAQ zwar nutzen, europäische Konzerngesellschaften dürfen an Entwicklung und Vertrieb aber nicht beteiligt sein. Diese Konstruktion ist eng gefasst und gehört in die Rechtsprüfung, nicht in die Architekturskizze. Quellen: Llama 4 Acceptable Use Policy und Meta-FAQ, abgerufen im September 2026.

Wo stehen offene Modelle im Vergleich zu den Spitzenmodellen?

Kurz gesagt: Bei klar umrissenen Aufgaben ist der Abstand praktisch verschwunden, bei offenen, mehrstufigen Aufgaben besteht er weiter. Vier Beobachtungen aus Modellkarten und Benchmarks:

  • Schlussfolgern ist weitgehend eingeholt. OpenAI gibt in der Modellkarte zu gpt-oss-120b an, dass das Modell bei Kern-Reasoning-Benchmarks nahe an o4-mini herankommt, und das bei einem Speicherbedarf, der auf eine einzelne 80-GB-GPU passt.
  • Programmieren: die Spitze liegt vorn, der Abstand ist messbar klein. Mistral gibt für Medium 3.5 in der Modellkarte 77,6 Prozent auf SWE-bench Verified an. Die proprietären Spitzenmodelle liegen darüber, für Standardaufgaben in der Entwicklung reicht der offene Stand aber aus.
  • Lange Kontexte sind kein Alleinstellungsmerkmal mehr. DeepSeek V4 bietet eine Million Token unter MIT-Lizenz. Entscheidend ist ohnehin nicht die Länge, sondern die Trefferqualität über lange Dokumente hinweg.
  • Multimodalität und Werkzeugnutzung: proprietär vorn. Bei Bildverständnis mit anschließendem Schlussfolgern, bei Browser- und Rechnerzugriff und bei agentischen Abläufen mit vielen Schritten ist die Reife der großen Anbieter weiterhin höher.

Wo offene Modelle heute produktiv reichen

  • Klassifikation, Extraktion, Weiterleitung
  • Einbettungen und semantische Suche
  • Antworten auf eigenen Wissensbasen
  • Standardisierte Chat- und Frage-Antwort-Abläufe
  • Code-Vervollständigung
  • Zusammenfassungen und Langtextanalysen

Wo proprietäre Spitzenmodelle vorn liegen

  • Autonome Abläufe mit vielen Werkzeugaufrufen
  • Entwicklungsaufgaben über ganze Projekte hinweg
  • Bildverständnis mit anschließendem Schlussfolgern
  • Rechner- und Browsersteuerung
  • Hohe Trefferqualität in sehr langen Kontexten
  • Mehrstufiges Reasoning

Welche Hosting-Wege gibt es für offene Modelle?

Drei Wege sind praktisch relevant, und sie unterscheiden sich weniger in der Modellqualität als im Betriebsaufwand und im Compliance-Profil.

Drei Wege zum offenen Modell

Weg Was es ist Wann sinnvoll Typische Anbieter
A. Managed-API Offene Modelle als Programmierschnittstelle bei einem spezialisierten Anbieter Schneller Einstieg, kleine bis mittlere Mengen, kein eigener Modellbetrieb In Europa unter anderem IONOS AI Model Hub, OVHcloud AI Endpoints, STACKIT AI Model Serving
B. Souveräne EU-Infrastruktur Offene Modelle auf dedizierter GPU-Infrastruktur in Europa Regulierte Bereiche, hohe Anforderungen an Betrieb und Nachweis Industrial AI Cloud von Telekom und NVIDIA, STACKIT, AWS European Sovereign Cloud, SAP mit Mistral
C. Eigener Betrieb Eigene GPUs, eigener Inferenz-Stack, etwa vLLM oder NVIDIA NIM Abgeschottete Netze, sehr hohe gleichmäßige Last, Spezialmodelle Eigenes Rechenzentrum oder Colocation

Weg A ist im Mittelstand der pragmatische Start. Die europäischen Anbieter machen dabei konkrete Zusagen: STACKIT nennt die Region Germany South und hält fest, dass Daten und Abfragen weder gespeichert noch zum Training verwendet werden.

OVHcloud wirbt mit „Zero Data Retention" und schließt die Nutzung der Daten zum Modelltraining aus. IONOS betreibt den AI Model Hub in deutschen Rechenzentren. Prüfen Sie die Zusagen im Vertrag, nicht auf der Produktseite.

Weg B ist 2026 erstmals breit verfügbar. Die Industrial AI Cloud von Telekom und NVIDIA läuft seit dem 4. Februar 2026 in München mit knapp 10.000 Blackwell-GPUs und bis zu 0,5 ExaFLOPS; als Partner nennt die Telekom unter anderem Siemens, SAP, Agile Robots und PhysicsX.

Die AWS European Sovereign Cloud ist seit dem 14. Januar 2026 in Brandenburg allgemein verfügbar, wird von in der EU ansässigem Personal betrieben und ist mit 7,8 Milliarden Euro hinterlegt.

Dazu kommt die Allianz von SAP und Mistral vom 18. November 2025, die Mistral-Modelle in die SAP-Plattform bringt.

Weg C ist für die meisten Mittelständler eine Falle. Er verlangt GPU-Kapazität rund um die Uhr, Überwachung, Prüfdatensätze, Sicherheitsprüfungen und einen erneuten Abgleich bei jedem Modellwechsel. Nach unserer Erfahrung aus Mittelstandsprojekten rechnet sich der eigene Betrieb gegenüber einer europäischen Managed-API erst bei sehr hohen, gleichmäßigen Mengen, und auch dann erst mit fest eingeplanter Betriebsmannschaft. Diese Schwelle ist eine Erfahrungsschätzung, keine belegte Kennzahl.

Wann rechnet sich Self-Hosting?

Die Antwort hängt an drei Größen: Menge, Sensibilität und vorhandene Betriebskapazität. Drei Konstellationen, die in der Praxis wiederkehren:

  1. Mittelständler mit 100 bis 500 Beschäftigten, Chat und Wissenssuche. Sinnvoll ist eine europäische Managed-API für die einfacheren Aufgaben, kombiniert mit einem proprietären Spitzenmodell für den anspruchsvollen Rest. Eigener Modellbetrieb lohnt sich hier in aller Regel nicht.
  2. Industrieunternehmen mit regulierten Daten. Wissensbasen aus der Entwicklung, Serviceautomatisierung, technischer Vertrieb. Sinnvoll ist eine souveräne EU-Infrastruktur für die regulierten Pfade und ein zusätzlicher Zugang zu Spitzenmodellen für alles andere.
  3. Abgeschottete Umgebungen, Behörden, Verteidigung. Hier führt kein Weg am eigenen Betrieb vorbei. Der Aufwand ist hoch, aber alternativlos.

Zwei Kostenposten werden in Eigenbetriebs-Rechnungen fast immer unterschätzt. Erstens das Personal: Ohne feste Kapazität für Betrieb, Bereitschaft und Modellpflege ist produktives Self-Hosting riskant. Zweitens der Leerlauf: Eine GPU-Instanz kostet auch dann, wenn niemand fragt. Wie Sie beides sauber gegenrechnen, steht im Artikel zu FinOps für KI.

Was sagt die KI-Verordnung zu offenen Modellen?

Offene Modelle sind teilweise entlastet, aber nicht freigestellt, und die Entlastung betrifft die Anbieter der Modelle, nicht deren Anwender.

Art. 53 Abs. 2 der KI-Verordnung nimmt Anbieter von Modellen, deren Parameter und Nutzungsinformationen unter einer freien und quelloffenen Lizenz veröffentlicht sind, von Teilen der Dokumentationspflichten aus. Die Ausnahme entfällt, sobald ein Modell als Modell mit systemischem Risiko eingestuft wird. Die Pflicht zu einer Urheberrechts-Policy und zu einer Zusammenfassung der Trainingsdaten bleibt auch für offene Modelle bestehen.

Für Unternehmen, die ein offenes Modell einsetzen, gilt die Betreiberperspektive: KI-Kompetenz nach Art. 4, Transparenz nach Art. 50 dort, wo Menschen mit dem System interagieren oder Inhalte erzeugt werden, und die Hochrisiko-Regeln, wo sie einschlägig sind. Ein internes Verzeichnis der eigenen KI-Anwendungen ist dafür gute Praxis und erleichtert jede spätere Prüfung, auch wenn es als solches nicht vorgeschrieben ist.

In Deutschland ist die Bundesnetzagentur als zentrale Aufsicht für die Marktüberwachung benannt und betreibt dafür einen KI-Service-Desk. Wer 2026 eine Plattform aufsetzt, sollte die eigenen Anwendungsfälle einordnen, bevor Fristen relevant werden.

Welche Regeln in welcher Reihenfolge greifen, ordnet der Compliance-Leitfaden zu DSGVO und KI-Verordnung ein. Konkrete Transparenzpflichten behandelt der Artikel zu Artikel 50. Diese Einordnung ersetzt keine Rechtsberatung.

Der Sonderfall DeepSeek: Gewichte ja, App nein

DeepSeek ist technisch eines der stärksten offenen Modelle und gleichzeitig datenschutzrechtlich umstritten. Die Unterscheidung, auf die es ankommt: Es geht um den Dienst des Anbieters, nicht um die Gewichte.

Die Berliner Beauftragte für Datenschutz und Informationsfreiheit hat die DeepSeek-Apps am 27. Juni 2025 gemeinsam mit den Aufsichtsbehörden aus Baden-Württemberg, Rheinland-Pfalz und Bremen nach Art. 16 des Digital Services Act bei Apple und Google als rechtswidrigen Inhalt gemeldet. Begründung: Personenbezogene Daten werden an chinesische Auftragsverarbeiter übermittelt, ohne dass die Anforderungen an Drittlandübermittlungen erfüllt sind.

Wer die V4-Gewichte unter MIT-Lizenz herunterlädt und auf europäischer Infrastruktur betreibt, löst genau dieses Problem strukturell: Es findet keine Übermittlung an den Anbieter statt. Zwei Restrisiken bleiben und gehören dokumentiert. Erstens die allgemeinen Sicherheitsfragen zu Modellen, deren Trainingsdaten nicht offengelegt sind. Zweitens die politische Dimension: In sicherheitsrelevanten Branchen fällt die eigene Risikoabwägung häufig zugunsten europäischer oder US-amerikanischer offener Modelle aus.

Die Hybridstrategie: vier Muster, die funktionieren

Die produktivste Architektur 2026 ist weder rein offen noch rein proprietär, sondern eine bewusste Aufteilung nach Menge, Sensibilität und Wert je Anfrage. Vier Muster haben sich bewährt:

  1. Suche offen, Antwort proprietär. Einbettungen und Suche laufen auf offenen Modellen, die finale Antwort erzeugt ein Spitzenmodell. Das senkt die Kosten der Hochvolumen-Schritte, ohne die Antwortqualität anzutasten.
  2. Nach Komplexität steuern. Einfache Klassifikation auf einem kleinen offenen Modell, komplexe Synthese auf einem Spitzenmodell. Voraussetzung ist ein Prüfdatensatz, der die Zuordnung belegt, statt sie zu behaupten. Hintergründe im Multi-Modell-Leitfaden.
  3. Eine Plattform, mehrere Anbieter. Offene und proprietäre Modelle laufen über dieselbe Oberfläche, dieselben Rechte und dieselben Protokolle. Ohne diese Klammer entstehen genau die Insellösungen, die später niemand auditieren kann.
  4. Abgeschottet für den harten Kern. Konstruktionsdaten, Rezepturen oder Quelltexte aus Auftragsentwicklung laufen auf einem selbst betriebenen offenen Modell, alles andere im normalen Betrieb.

Vier Fehler, die immer wieder vorkommen

Die meisten Fehlentscheidungen bei offenen Modellen entstehen nicht in der Technik, sondern bei Lizenz, Datenfluss und Betrieb. Diese vier Muster begegnen uns in Projekten regelmäßig.

Llama 4 als Standardwahl einplanen

Wenn in einem Architekturvorschlag Llama 4 auftaucht, fragen Sie nach der Lizenzprüfung. Für Unternehmen mit Hauptsitz in der EU sind die multimodalen Modelle ausgenommen.

Den Dienst mit dem Modell verwechseln

Offene Gewichte selbst betreiben und den Cloud-Dienst desselben Anbieters nutzen sind zwei völlig verschiedene Datenflüsse mit völlig verschiedenen Rechtsfolgen.

Self-Hosting ohne feste Betriebskapazität

Modellbetrieb nebenbei führt zu stillen Ausfällen und veralteten Ständen. Ohne eingeplante Kapazität für Betrieb und Modellpflege gehört der eigene Betrieb nicht in den Plan.

Offen mit datenschutzkonform gleichsetzen

Offene Gewichte erfüllen keine einzige Anforderung der DSGVO von selbst. Erst Hosting, Auftragsverarbeitungsvertrag, Rechte, Protokollierung und Löschkonzept ergeben einen belastbaren Stack.

In drei Schritten zur belastbaren Entscheidung

Eine belastbare Entscheidung für oder gegen offene Modelle stützt sich auf eigene Messdaten statt auf Ranglisten. Drei Phasen über etwa ein Quartal reichen dafür in der Regel aus.

  1. 1

    Bestand aufnehmen

    Woche 1 bis 4

    Die fünf wichtigsten Anwendungsfälle mit Mengengerüst, Datenklasse und Qualitätsanspruch beschreiben. Dazu die heutige Modellrechnung als Ausgangswert festhalten.

  2. 2

    Gegen offene Modelle messen

    Woche 5 bis 8

    Je Anwendungsfall einen Prüfdatensatz mit echten Anfragen bauen und offene Modelle über eine europäische Managed-API gegen den heutigen Stand testen. Qualitätsabstand und Kosten je 1.000 Anfragen dokumentieren.

  3. 3

    Hybrid produktiv setzen

    Woche 9 bis 12

    Pro Anwendungsfall das wirtschaftlichste Modell mit ausreichender Qualität festlegen, alles über eine Plattform mit einheitlichen Rechten und Protokollen betreiben und einen festen Termin für die Neubewertung einplanen.

Wie Sie die Qualität dabei sauber messen, statt sie zu schätzen, beschreibt der Artikel zu Evaluation und Beobachtbarkeit.

Wie Plotdesk offene und proprietäre Modelle zusammenbringt

Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand und bringt offene und proprietäre Modelle in einer Plattform zusammen. Über den Model Garden stehen mehr als 100 Modellvarianten aus zehn Provider-Typen zur Verfügung, darunter offene Modelle wie Mistral, gpt-oss oder DeepSeek, wahlweise über EU-Inferenz oder selbst betrieben über OpenAI-kompatible Endpunkte wie vLLM, sowie die proprietären Spitzenmodelle.

Welche Modelle ein Team nutzen darf, wird pro Team, Gruppe und Anwendung freigegeben.

Der Betrieb ist dediziert je Kunde: als Plotdesk Cloud, von Plotdesk betrieben und in der EU gehostet, als Private Cloud oder im eigenen Tenant, zum Beispiel in Azure. Dazu kommen ein DSGVO-konformer Auftragsverarbeitungsvertrag mit EU-Datenresidenz, Single Sign-On, Rollen und mehr als 40 Berechtigungen sowie Audit-Logs. Nutzungs- und Kostenanalysen je Team und Bereich zeigen, wohin die Mengen laufen. Das ist die Grundlage sowohl für Ihr internes KI-Verzeichnis als auch für die Kostensteuerung.

Bestehende Systeme bleiben, wo sie sind: ERP, Fileserver, Ticket-System oder ältere Datenbanken werden über Plotdesk Connect angebunden. Und weil Modellschicht und Plattformschicht getrennt sind, ist ein Wechsel des Modells oder des Hosting-Wegs kein Migrationsprojekt. Wie sich das in gewachsene Landschaften einfügt, zeigt der Leitfaden zur Integration bestehender Systeme.

Häufige Fragen zu Open-Source-LLMs

Sind Open-Source-LLMs automatisch DSGVO-konform?

Nein. Offene Gewichte sagen nichts über die Verarbeitung aus. Entscheidend sind Hosting-Ort, Auftragsverarbeitungsvertrag, Berechtigungen, Protokollierung und Löschkonzept. Wer offene Modelle in Europa betreibt oder betreiben lässt, hat es leichter, muss die Anforderungen aber trotzdem erfüllen.

Darf ein deutsches Unternehmen Llama 4 einsetzen?

Die multimodalen Llama-4-Modelle sind laut Metas Nutzungsrichtlinie für Unternehmen mit Hauptsitz in der EU ausgenommen. Endnutzer eines Produkts, das solche Modelle enthält, sind davon ausdrücklich nicht betroffen. Für den eigenen Stack gehört die Lizenzfrage in die Rechtsprüfung.

Was kostet der eigene Betrieb eines offenen Modells?

Die Hardware ist selten der größte Posten. Hinzu kommen Betrieb und Bereitschaft, Überwachung, Prüfdatensätze, Sicherheitsprüfungen und ein Abgleich bei jedem Modellwechsel. Rechnen Sie den eigenen Betrieb nur dann, wenn Sie diese Kapazität fest einplanen können.

Kann ich DeepSeek in Deutschland einsetzen?

Die Gewichte stehen unter MIT-Lizenz und lassen sich auf europäischer Infrastruktur betreiben. Die App und die Programmierschnittstelle des Anbieters sind für personenbezogene Daten in Deutschland dagegen datenschutzrechtlich problematisch, wie die Meldung der Berliner Aufsichtsbehörde von 2025 zeigt.

Wie stark ist der Qualitätsabstand zu GPT und Claude?

Bei Klassifikation, Extraktion, Suche und Zusammenfassungen ist er für die meisten Anwendungsfälle nicht mehr spürbar. Bei mehrstufigen Agenten, Werkzeugnutzung und Multimodalität bestehen weiterhin Unterschiede. Messen Sie das an eigenen Beispielen statt an Ranglisten.

Brauche ich für offene Modelle eigene GPUs?

Nein. Europäische Anbieter stellen offene Modelle als Programmierschnittstelle bereit, abgerechnet nach Verbrauch. Eigene GPUs brauchen Sie erst bei abgeschotteten Umgebungen, Spezialmodellen oder sehr hoher gleichmäßiger Last.

Fazit: Option, nicht Glaubensfrage

Offene Sprachmodelle sind 2026 eine ernsthafte Option für den Mittelstand, aber keine pauschal bessere Wahl. Den Ausschlag geben Lizenz, Datenklasse und Betriebskapazität.

Wer offene Modelle einsetzt, weil sie gerade gut klingen, baut sich Betriebsaufwand auf. Wer sie ignoriert, verschenkt Spielraum bei Kosten, Datenkontrolle und Unabhängigkeit von einzelnen Anbietern.

Drei Dinge nehmen Sie mit: Die Lizenz entscheidet vor der Technik, besonders bei Llama 4. Die Hybridarchitektur ist die produktive Antwort, nicht die Grundsatzentscheidung. Und Self-Hosting ist eine Betriebsverpflichtung, die sich nur bei klarem Anlass lohnt.

Wer entlang dieser drei Punkte entscheidet, kommt zu einer Architektur, die Modellwechsel übersteht, statt bei jedem neuen Modell erneut zur Debatte zu stehen. Die strategische Einordnung liefert der Leitfaden zu souveräner KI im Mittelstand.

Zuletzt redaktionell überarbeitet am

Nächster Schritt

Finden wir den Prozess, der sich für Sie rechnet.

In der persönlichen KI-Potenzialanalyse prüfen wir Ihre Ausgangslage und entwickeln eine konkrete Hypothese für den schnellsten wirtschaftlichen Hebel. Von der ersten Idee bis zur Lösung im Betrieb.

Persönlich sprechen
  • 1.200+Use Cases in 15 Branchen
  • 4 Wochenbis zum ersten Ergebnis im Betrieb
  • DediziertIhre Instanz in der EU oder in Ihrem eigenen Tenant

Die Expertise und Kreativität haben zu einer Lösung geführt, die unternehmensweit großen Anklang findet. Paul Töws, AI Hub Lead, Melitta

Persönliche Einschätzung

Wo liegt Ihr größter KI-Hebel?

Vier kurze Fragen zu Ihrem Unternehmen. Wir prüfen Ihre Angaben persönlich und melden uns mit einer ersten Einschätzung.

Persönliche Analyse

Wo liegt Ihr größter KI-Hebel?

Vier kurze Fragen zu Ihrem Unternehmen. Wir prüfen Ihre Angaben persönlich und bereiten eine erste Einschätzung vor.

Niklas CoorsGeschäftsführer · Strategie

Schritt 1 von 5
In welcher Branche arbeitet Ihr Unternehmen?

Damit ordnen wir passende Referenzen und Use Cases zu.

Wie groß ist Ihr Unternehmen?

So können wir einschätzen, was zu Ihrem Unternehmen und Ihren Teams passt.

Wo stehen Sie heute mit KI?

Welche Aussage beschreibt Ihren Arbeitsalltag am besten?

Welcher Hebel hat gerade höchste Priorität?

Wählen Sie den Bereich, in dem ein Ergebnis am meisten bewegen würde.

Wie dürfen wir Sie erreichen?

Wir prüfen, wo KI in Ihrem Unternehmen konkret helfen kann, und melden uns persönlich mit einer ersten Einschätzung.