Commoditech Schreiben Sie uns
← Zurück zu den Artikeln

MLOps-Services: Datendrift, CI/CD und Body Leasing

Das Modell hat einen F1-Score von 0,81 auf dem Datensatz vom April. Im August liefert derselbe endpoint Vorhersagen, die niemand manuell unterschreiben würde. Niemand hat den PSI berechnet. Niemand hat den retrening gestartet. Oder umgekehrt: Ein cron verbrennt jeden Sonntag GPU-Ressourcen, weil „es so im runbook steht“, während die Merkmalsverteilung seit sechs Wochen unverändert ist.

Das ist kein Algorithmusproblem. Das ist ein Schleifenproblem. MLOps-Dienstleistungen sind nicht „DevOps, der Python kann“. Das ist CI/CD plus continuous training: Drift-Erkennung, retrening-Gateway, Modellregister, serving mit demselben Feature-Code wie beim Training. Ohne diese Schleife kaufen Sie ein pickle mit einem Ticket für die Plattform.

Unten finden Sie eine Unterscheidung, die in Briefings wie „Wir suchen einen MLOps-Ingenieur“ oft fehlt: wann man eine einzelne Person anheuert (body leasing eines MLOps-Ingenieurs), und wann Drift und serving einen Squad erfordern aus DE + DS + MLOps. Die Stundensätze haben wir separat aufgeführt: was IT body leasing im Jahr 2026 kostet. Hier berechnen wir, warum retrening nach Zeitplan der teuerste Weg zu einem stabilen F1-Score ist.

Ein Satz, der auf der Folie „ML platform“ fehlt

Kubeflow ohne Drift-Verantwortlichen ist CI für Images. Keine MLOps-Dienstleistungen. PSI über 0,25 ist ein Signal, kein Dashboard. Wenn niemand die Berechtigung hat, den serving zu stoppen und einen retrening aus einem commit zu starten, haben Sie eine Demo mit GPU.

1. Anatomie: Retraining nach Kalender ist nicht continuous training

Eine typische Woche eines Modells in Produktion in einer Bank, einem Telco-Unternehmen oder im Einzelhandel sieht nicht aus wie ein MLflow-Tutorial. Sieht aus wie drei getrennte Schleifen:

  • Training. Data Scientist im Studio / Notebook. Artefakt: model.pkl oder eine Karte im Model Registry, die niemand promoted.
  • Deploy. Ein Ticket an DevOps. Image, Probe, Ingress. Rollback beherrscht das Plattformteam. Rollback einer Feature-Definition beherrscht niemand.
  • „Monitoring“. Grafana für Latenz und 5xx. Nicht für Population Stability Index, nicht für KS, nicht für den Rückgang von F1 bei verzögerten Labels.

Kreuzberger, Kühl und Hirschl trennen in ihrem Überblick über die MLOps-Architektur (IEEE Access, 2023) CI/CD von continuous training (CT): die vierte Schleife, die Daten, Modell und Serving verbindet. Ohne CT haben Sie eine Software-Pipeline. Keine Lern-Pipeline. Sculley et al. (NIPS 2015) nannten es bereits: Lerncode ist normalerweise ein kleiner Bruchteil des Systems; der Rest ist Klebstoff, Konfiguration und versteckte Abhängigkeiten. Die Änderung eines Features zieht eine Lawine nach sich — CACE, changing anything changes everything.

Drei Anzeichen, dass Sie Cron haben, nicht CT:

  1. Retraining nach Kalender. Sonntag 02:00 Uhr, unabhängig vom PSI. Oder nie, „weil das Modell gut genug ist“. Beide Varianten verbrennen entweder Qualität oder Cloud-Ressourcen.
  2. Feature zweimal berechnet. Pandas auf dem Laptop, SQL in Airflow. Die Fill-Rate weicht um 0,3 pp ab und zeigt sich nach einem Quartal, wenn der Drift bereits in der Entscheidung ist.
  3. Verzögertes Label, blinde Metrik. F1 in Produktion lässt sich erst nach Wochen berechnen. Bis dahin ist das einzige Signal der Eingangsdrift (PSI, KS, KL, MMD) — oder nichts.

Daher ist ein Briefing „DevOps-Mitarbeiter für Modelle mieten“ ohne Drift-Kontext der teuerste Weg zu einem weiteren pickle. Die Kompetenzen, die tatsächlich MLOps-Dienstleistungen erbringen, finden sich in drei Bereichen: MLOps-Ingenieure, Data Engineering, Data Science. GPU serving und LLM ergänzen AI / RAG und DevOps / SRE.

2. Was Studien sagen, nicht die Decks von „ML platform“

Sie brauchen keine weitere Definition der MLOps-Reife. Sie brauchen einen Schwellenwert, ab dem ein Retraining starten darf — und das Recht, nicht zu starten, wenn die Verteilung stabil ist.

  • PSI > 0,25 ist keine Dashboard-Meinung. Katalay, Dimandja und Masakuna, A Multi-Criteria Automated MLOps Pipeline for Cost-Effective Cloud-Based Classifier Retraining in Response to Data Distribution Shifts (arXiv:2512.11541, Dezember 2025): kombinieren KS, KL, PSI, MMD sowie ΔAcc/ΔF1 zu einem einzigen Score und starten das Retraining erst nach Überschreiten eines Schwellenwerts. In der Scoring-Literatur bedeutet ein PSI über 0,25 seit Jahren einen signifikanten Drift; unter 0,10 — Rauschen. Die Pipeline rät nicht. Sie rechnet.
  • Retraining bei jedem Alarm ist teurer als Drift. Im selben Experiment (autoencoder, anomaly detection Datensätze) vier Strategien: STATIC (null Retraining) hält eine Accuracy von 0,69±0,2 bei Kosten von 54,8; FIXED (festes Intervall) und NAIVE (Retrain bei jedem Drift) erreichen 0,75, kosten aber 160,6 und 130,5 bei 3,0 und 4,3 Retrainings. Auto-MLOps: dieselben 0,75±0,03, Kosten 108,1, Retrainings 1,4±1,2. Dieselbe Qualität wie der Kalender, ein Drittel günstiger als FIXED, dreimal weniger Starts als NAIVE.
  • Architektur ohne Rollen ist eine Folie. Kreuzberger et al. (2023): MLOps sind Praktiken und Rollen (ML Engineer, Data Engineer, DevOps), kein Produkt vom Marketplace. CT ist eine Schleife, kein Knopf in Vertex. DORA 2024 ergänzt: Elite vs. Low ist eine Größenordnung in der Deploy-Frequenz und Lead Time. Fünf Timesheets (DS von Vendor A, DE von B, „jemand für Kubernetes“ von C) ergeben keine Lead Time. Sie ergeben drei Ersatz-SLA. Die Anatomie dieses Fehlers haben wir in team leasing vs body leasing 2026 beschrieben. Der Datenstrom, der CT speist, ist im Artikel über prädiktive Analysen.

Wichtige architektonische Schlussfolgerung

MLOps-Dienste beginnen am Gateway, nicht am Cluster. Der Drift-Detektor (PSI/KS/KL) schreibt ein Ereignis. Die Policy entscheidet, ob der Datensatz gemischt und trainiert werden soll. CI validiert das Feature-Schema und die Metrik vs. Baseline. CD bewirbt die Version im Register. Serving liest dieselbe Feature-Definition. Wenn eine der Stufen ein Mensch ist, der CSV einfügt, haben Sie kein CT. Sie haben Bereitschaftsdienst.

3. Fallstudie aus der Produktion: Sonntags-Retraining, das nichts behoben hat

Aus der Ingenieurpraxis: von cron bis PSI

Fraud-Scoring, Retail / Zahlungen. Quellen: Postgres, Events in Kafka, Features in dbt, Serving auf Kubernetes. Das Team arbeitete wie folgt:

  • Training: Data Scientist, SageMaker Studio, manueller Export des Artefakts,
  • Deploy: Ticket, Docker, Helm, ohne Test des Eingabeschemas,
  • Retraining: cron am Sonntag, vollständiger Datensatz, GPU für vier Stunden,
  • Monitoring: p99 und 5xx. PSI wurde von niemandem berechnet.

Problem: nach Änderung des Kanalmixes (neuer Zahlungspartner) sank F1 auf dem verzögerten Label innerhalb von zwei Wochen. Der cron am Sonntag trainierte auf einer Mischung, in der der neue Kanal Rauschen war. Die GPU-Kosten stiegen. Die Qualität nicht.

Änderung: Berechnung von PSI und KS auf einer Stichprobe aus VPC, Schwellenwert 0,25 als Alert in CI, nicht in Slack „für alle Fälle“. Retraining nur, wenn der Drift-Score τ überschreitet und ΔF1 auf dem Holdout negativ ist. Das Modellregister (MLflow) bewirbt die Version. Serving mit demselben Feature-Code (offline batch = online). DevOps bleibt beim Image und IAM. MLOps bleibt beim Gateway.

Messung: Anzahl der Retrainings von 4/Monat auf ~1,5. Die gleiche Größenordnung an Accuracy wie „immer trainieren“, GPU-Rechnung näher an Auto-MLOps mit Katalaya als FIXED. Zeit vom PSI-Alert bis zur neuen Version in Produktion: Stunden, nicht Sprint. Das ist keine Vertex-Magie. Das ist der Eigentümer der CT-Schleife.

Die Zahlen aus dem Paper übertragen sich nicht 1:1 auf Ihr Scoring. Was sich überträgt, ist die Mechanik: Kalender und ein naiver Alarm sind zwei Wege, das Budget zu verbrennen. Ein Gateway mit mehreren Kriterien ist der dritte – und der einzige, der vor einem Risikoausschuss auditiert werden kann.

4. Entscheidungstabelle: welches CT, welche Teamzusammensetzung

Ansatz Komplexität Qualität bei Drift Kosten Cloud / GPU Overhead für das Team Wann anwenden
STATIC — Modell einmalig, kein Retraining Niedrig Fällt mit Drift ab (im Paper 0,69 vs 0,75) Niedrig Niedrig, bis es explodiert PoC, kein SLA, Datensatz ist statisch
FIXED — Retraining nach Kalender Niedrig–Mittel Hält die Qualität, wenn der Drift regelmäßig ist Hoch (im Paper 160,6 vs 108,1) Mittel (Sonntagsbereitschaft) Regulierter Batch, zuverlässige Labels, GPU-Budget tut nicht weh
NAIVE — Retrain bei jedem Drift-Alert Mittel Hält die Qualität, viele Fehlstarts Hoch (4,3 Retrainings vs 1,4) Hoch (Alert-Rauschen) Wenn der Detektor schlecht ist und Sie Angst haben, einen Shift zu verpassen
Multikriterielles Gateway (PSI/KS/KL + ΔF1 + CI/CD) Hoch Gleiche Größenordnung wie FIXED/NAIVE Mittel (niedrigster unter den Schleifen) Anfänglich hoch, sinkt, wenn die Schleife stabil ist Enterprise, NDA, GPU, Risikokommission möchte Audit 'warum jetzt'
Managed Service (SageMaker / Vertex / Azure ML) + CT-Verantwortlicher Mittel (Integration) Abhängig davon, ob Sie den Detektor aktivieren, nicht nur die UI Mittel–Hoch (Service-Metriken) Operativ niedriger, wenn IAM bereits vorhanden ist Eine Cloud, ein IAM, jemand muss trotzdem den Schwellenwert festlegen

MLOps ist kein Python CRUD und kein „gewöhnlicher DevOps“. Stundensätze DevOps/SRE: 140–200 / 200–325 PLN/h (Spezialist / Kunde). AI/LLM in der Produktion: 180–250 / 240–350 PLN/h. Ein MLOps-Ingenieur mit GPU-Serving und Drift liegt in diesem Bereich, näher am oberen Ende, wenn Retraining im SLA enthalten ist. Marge 10–25%. Eine Orientierung, keine Preisliste — Details in den Sätzen 2026.

5. Anti-Muster, die es im Kubeflow-Tutorial nicht gibt

  1. Briefing „DevOps mit Python-Kenntnissen“ für CT. Sie erhalten Helm und probe. Sie erhalten weder PSI noch einen Feature-Schema-Test. Der Markt ist gespalten: Klassische DevOps haben ein hohes Angebot, ML-Loop-Ingenieure nicht. Eine falsch etikettierte Ausschreibung sammelt Lebensläufe innerhalb von 48 Stunden, aber null Kompetenzen gegen Drift.
  2. Dashboard statt Gateway. Evidently in Grafana, ein Alert in Slack, manuelles Retraining „wenn Zeit ist“. Das ist Monitoring. Keine MLOps-Dienstleistungen. Ein Gateway hat das Recht, die Promotion einer Version ohne menschliches Eingreifen im Kanal zu stoppen.
  3. Retraining auf dem vollständigen Datensatz, weil es einfacher ist. Katalay et al. zeigen, warum man neuen Drift mit dem alten Datensatz mischen sollte, anstatt jede Woche von Grund auf neu zu trainieren. Ein vollständiges Retraining ohne Detektor ist das FIXED aus dem Paper: Die Qualität stimmt, die Rechnung auch.
  4. Schein-ML-Team. Data Scientist von Vendor A, Data Engineer von B, MLOps „zu 20% von der Plattform“. Drei Onboardings, kein gemeinsamer DAG, keine gemeinsame Definition of Done für die Modellpromotion. Das ist kein staff augmentation. Das ist die Integrationssteuer, die beim team leasing beschrieben wird.

6. Playbook: Wen einstellen und in welcher Reihenfolge

Beginnen Sie nicht mit dem Cluster. Beginnen Sie mit der Frage, welche Schleife das SLA blockiert: Daten, Modell, Drift oder Serving.

  1. Eine Lücke in der bestehenden Schleife. Sie haben Airflow, ein Register und jemanden, der PRs überprüft. Es fehlt ein PSI-Eigentümer und das CD des Modells. Das ist klassisches Body Leasing von MLOps-Ingenieuren: eine Person, Ihr Stand-up, Ihr DoD. Erste Profile innerhalb von Tagen, nicht in einem Quartal – wir sourcen auf Anfrage, wir verkaufen keine namentliche Bank für morgen früh.
  2. Das Notebook ist das einzige Artefakt. Es gibt keinen DAG, keinen Schematest, kein Serving. Eine Person kann das nicht zusammenfügen. Zusammensetzung 3–5: DE (Quellen, dbt/Spark), DS (Modell, Validierung), MLOps (Image, Drift, Promotion). Das ist näher am team leasing als an „wir kaufen noch einen DevOps dazu“.
  3. Daten verlassen die VPC nicht. Auftragnehmer in Ihrem IAM, Ihre Cloud, NDA und Datenverarbeitung im Auftrag. Colab mit einem Produktions-Dump „um PSI zu berechnen“ ist ein Leak. Offline-Features im Batch, Online-Serving mit demselben Code.
  4. Ramp-up. Person für ein bestehendes Team: erster Lebenslauf 24–48 h, Start nach Ihren Gesprächen und Vertrag. Squad von Grund auf: Wochen, kein Sprint, da Sie Berechtigungen, Daten und DoD für die Modellpromotion zusammenfügen. Die Lüge „drei MLOps-Senioren ab Montag“ ist ein Lebenslauf oder eine Bank, die wir nicht haben – und wir werden nicht so tun.

Commoditech bietet seit 2012 T&M und Festanstellung aus Warschau an. Über 80 Spezialisten im Netzwerk, keine idle bench. Ein T&M-Briefing oder eine Success Fee lässt sich über IDE mittels MCP für KI-Agenten erstellen, nicht nur über ein Formular. Beträge für einen spezifischen Stack werden von einem Menschen berechnet; die Spannen sind im Artikel über die Tarife, nicht im JSON des Agenten.

FAQ

Worin unterscheiden sich MLOps-Services von klassischem DevOps bei ML-Modellen?

DevOps liefert Image, Probe und Rollback. MLOps liefert zusätzlich: Modell-Registry, Feature-Schema-Tests, Drift-Erkennung (PSI, KS, KL), Retraining-Gate und Serving mit demselben Feature-Code wie im Training. CI/CD ohne continuous training ist ein pickle-Deployment. Keine Plattform. Kreuzberger et al. (2023) definieren CT explizit als separate Schleife – nicht als „einen weiteren Job in Jenkins“.

Wann sollte man einen einzelnen MLOps-Ingenieur beauftragen und wann ein Team?

Eine Einzelperson, wenn DAG, Registry und IAM bereits stehen und lediglich ein Owner für Drift und Modell-CD fehlt. Ein Team aus 3–5 Personen (DE + DS + MLOps), wenn das einzige Artefakt ein Notebook ist und das Retraining ein Jira-Ticket. Ein MLOps allein ohne DE repariert nicht die Quelle. Ein Data Scientist allein ohne MLOps liefert AUC. Er liefert weder p99 noch das Audit „warum genau diese Version“. Wenn Sie niemanden haben, der den PR des Contractors reviewt, kaufen Sie kein Body Leasing. Kaufen Sie einen Lead plus eine Rolle oder ein Squad.

Was kostet Body Leasing für einen MLOps-Ingenieur in Polen im Jahr 2026?

MLOps liegt zwischen DevOps/SRE (Kunde 200–325 PLN/h) und produktivem AI/LLM (240–350 PLN/h). GPU-Serving und driftbasiertes Retraining treiben den Stundensatz an das obere Ende der Spanne. Dienstleistermarge 10–25% – wenn jemand 8% bei einem Ersatz innerhalb von 5 Tagen verspricht, schlagen Sie das in einer anderen Zeile drauf. Das ist eine Marktübersicht, kein Angebot. Den Betrag für das Briefing kalkuliert ein Mensch. Details unter Stundensätze 2026.

Kann ein MLOps-Contractor mit Daten unter NDA und RODO arbeiten?

Ja: Ihre Umgebung, Ihr IAM, Ihre Cloud oder On-Prem, T&M-Vertrag mit NDA, Auftragsverarbeitung und IP auf Kundenseite. Ein Produktionsdump auf das Laptop des Contractors, „um schneller PSI zu berechnen“, ist ein Datenleck. Drift berechnen Sie auf einem Sample in der VPC, nicht in Colab. Das Zugriffs-Audit liegt bei Ihnen. Klauseln: Verträge, Margen, IP.

Quellen