Zum Inhalt springen
Beauty & Wellness kosmetikformulierungstabilitaetstestemulsion

Emulsionsstabilität-Prognose: ML sortiert instabile Rezepturen vor dem Lagertest aus

Neue Bio-Cremes trennen sich nach dem Abfüllen, Monate später, zu spät für eine Rückrufvermeidung. ML-Stabilitätsprognose aus Formulierungsparametern erkennt wahrscheinliche Instabilität vor dem ersten Ansatz; den Pflicht-Stabilitätstest ersetzt sie nicht.

⚡ Auf einen Blick
Problem
Stabilitätstests für Kosmetikformulierungen dauern 3–6 Monate (Klimakammer, Zentrifuge, Lagersimulation). Organische Emulgatoren und biozertifizierte Wirkstoffkombinationen verhalten sich unvorhersehbarer als konventionelle Formulierungen. Ein fehlgeschlagener Stabilitätstest nach 4 Monaten bedeutet: Neuformulierung, weiteres halbes Jahr Wartezeit, Markteinführung verschoben.
KI-Lösung
ML-Modell trainiert auf historischen Stabilitätsdaten aus Formulierungsdatenbanken. Eingabe: Emulgatorsystem, Wirkstoffkonzentrationen, pH, Wasseraktivität. Ausgabe: Stabilitätsprognose mit Konfidenzintervall als Vorfilter vor dem Labortest.
Typischer Nutzen
Wer instabile Kandidaten vor dem Labor aussortiert, spart Testdurchläufe und damit Monate Durchlaufzeit. Wie viele, zeigt erst das Back-Testing auf den eigenen Daten, und die Lizenz kostet laufend, bevor sie etwas spart.
Setup-Zeit
Eigene historische Stabilitätsdaten nötig, Aufbau dauert Jahre oder Kooperationspartner
Kosteneinschätzung
Plattform-Implementierung 20.000–80.000 € einmalig; SaaS-Lizenz 1.500–5.000 €/Monat laufend
Eigenes Python/Scikit-learn-ModellIntellico Matilde SaaSUncountable ELN+ML Enterprise
Worum geht's?

Es ist März. Formulierungschemikerin Lena Bartel hat sechs Monate an der neuen feuchtigkeitsintensiven Gesichtscreme gearbeitet, Cica-Extrakt, ein Bio-Emulgator auf Zuckerester-Basis, Sheabutter im höheren Konzentrationsbereich. Das Produkt ist klinisch geprüft. Das Verpackungsdesign steht. Der Listungstermin beim Drogeriegroßkunden ist für September bestätigt.

Dann, bei der finalen Stabilitätskontrolle nach vier Monaten, die Nachricht aus dem Labor: Phasentrennung im 40°C-Klimaschrank. Die Öl-Phase scheidet sich ab. Die Emulsion ist nicht stabil.

Ursache: Das Zuckerester-System interagiert bei diesem pH-Wert und dieser Sheabutter-Konzentration anders als erwartet, eine Kombination, die so in der Formulierungsdatenbank noch nicht aufgetaucht ist. Vier Monate Laborzeit. Zwei geplante Testchargen à 8.000 Euro. Neun Monate Gesamtentwicklungszeit, verloren. Der Septemberlisting-Termin ist passé.

Das ist kein Einzelfall, gerade in der Naturkosmetik.

Für Unternehmen

Nicht nur lesen, umsetzen.

Wir setzen Anwendungsfälle wie diesen mit euch um oder trainieren euer Team darauf. Das Erstgespräch kostet nichts.

Erstgespräch anfragen

Das echte Ausmaß des Problems

Stabilitätstests sind keine Formalität. Sie sind nach EU-Kosmetikverordnung 1223/2009 Pflicht: Ohne nachgewiesene Produktstabilität darf kein Kosmetikum auf den europäischen Markt. Der Cosmetic Product Safety Report (CPSR) muss die Stabilitätsdaten enthalten, kein Stabilitätstest, kein Listing.

Das klingt beherrschbar, bis man die Zeitachse sieht.

Eine feste gesetzliche Testdauer gibt es für Kosmetik nicht, die ICH-Leitlinien mit ihren Langzeitstudien gelten für Arzneimittel. Üblich ist nach Branchenleitlinien wie ISO/TR 18811 ein beschleunigter Test, oft drei Monate bei 40 °C, dazu Langzeitlagerung, Zentrifugentests und Temperaturwechsel, für eine einzige Rezepturvariante. Was ein externer Test kostet, hängt am Protokoll; eine öffentliche Preisliste, die wir bestätigen konnten, haben wir nicht gefunden. Frag zwei Labore an, bevor du rechnest.

Das eigentliche Problem ist nicht der Test. Es ist die Iterationsschleife: Eine Emulsion, die nach drei Monaten durchfällt, bedeutet eine Neuformulierung, und der nächste Testdurchlauf beginnt wieder bei Woche null. Zwei oder drei Iterationen, und aus einer geplanten Markteinführung in neun Monaten wird ein 18-Monate-Projekt.

Für Naturkosmetik-Formulierungen verschärft sich dieses Problem strukturell:

  • Bio-zertifizierte Emulgatoren (Zuckerester, Methylglucose-Derivate, Lecithin) sind empfindlicher auf pH-Schwankungen und Temperatur als synthetische Alternativen
  • Wirkstoffkombinationen aus Pflanzenextrakten bringen natürliche Variabilität mit, die gleiche botanische Charge verhält sich von Ernte zu Ernte leicht anders
  • Eingeschränkte Konservierungssysteme (COSMOS-konform ohne klassische Parabene oder Phenoxyethanol) lassen weniger Spielraum bei pH und Wasseraktivität

Große Hersteller investieren sichtbar in KI für die Formulierung: L’Oréal hat im Januar 2025 angekündigt, mit IBM ein eigenes KI-Grundmodell für Rezepturdaten zu entwickeln. Belastbare, unabhängige Zahlen, wie viele Entwicklungsrunden eine ML-Stabilitätsprognose tatsächlich einspart, haben wir nicht gefunden.

Mit vs. ohne KI, ein ehrlicher Vergleich

KennzahlKlassischer ProzessMit ML-Stabilitätsprognose
Stabilitätsprognose für neue Rezeptur3–6 Monate LabortestStunden bis Tage (initiale Prognose als Vorfilter)
Anzahl Testdurchläufe bis stabiler FormulierungOft mehrereWeniger, wenn das Modell trifft; wie viele, zeigt dein Back-Testing
Kosten pro gescheitertem TestdurchlaufTestgebühr plus Rohstoffe und Laborstunden der TestchargeEntfällt für Kandidaten, die das Modell zu Recht aussortiert; fälschlich aussortierte gute Kandidaten gehen dir verloren
Erkennbares RisikoNach dem LabordurchlaufVor dem ersten Laboransatz
Regulatorische PflichttestsNicht ersetzbar, Pflicht nach EU-VO 1223/2009Nicht ersetzbar, Pflicht bleibt
Begründbarkeit gegenüber BehördenExperimentelle DatenExperimentelle Daten + ML als Vorab-Screening

Die vorletzte Zeile ist entscheidend: ML-Stabilitätsprognose ersetzt keine regulatorisch vorgeschriebenen Labortests. Es ist ein Vorfilter, ein System, das unstabile Kandidaten aussortiert, bevor sie in teures Labor-Equipment und Klimakammerzeit gesteckt werden. Der validierende Test kommt danach, ist aber dann für einen deutlich kleineren Kandidatenpool erforderlich.

Einschätzung auf einen Blick

Zeitersparnis, mittel (3/5) Hier muss man zwei Zeiten trennen. Die Durchlaufzeit bis zur Markteinführung kann um Monate schrumpfen, wenn ein Fehlansatz wegfällt, denn jeder Stabilitätstest läuft Wochen bis Monate. Die Zeit wird nicht aus dem Test gespart, den gibt es nach wie vor, sondern aus den Iterationen davor. Das ist bei fixen Retailer-Listingterminen ein echter Wettbewerbsvorteil, aber es ist Wartezeit, keine Arbeitszeit: Während die Probe im Klimaschrank steht, arbeitet niemand an ihr. Arbeitszeit spart nur das Ansetzen, Abfüllen und Prüfen der Chargen, die nicht mehr gemischt werden müssen, also einige Labortage je vermiedenem Fehlansatz. Dafür eine 3; wer nach Time-to-Market fragt, darf gedanklich höher greifen.

Kosteneinsparung, mittel (3/5) Ein vermiedener Fehlansatz spart Rohstoffe, Laborstunden und die externe Testgebühr. Was das bei euch ist, steht in der Kostenstellenrechnung; eine belastbare Branchenzahl haben wir nicht. Dagegen stehen geschätzt 1.500 bis 5.000 Euro Lizenz im Monat und ein Aufbau von 20.000 bis 80.000 Euro. Ob das aufgeht, hängt allein daran, wie viele Fehlansätze das Modell wirklich verhindert; die Rechnung unten zeigt, wie knapp das werden kann.

Schnelle Umsetzung, niedrig (1/5) Das ist der härteste Punkt dieser Kategorie. Um ein ML-Stabilitätsmodell zu trainieren, braucht es historische Stabilitätsdaten aus eigenen Formulierungsversuchen, systematisch dokumentiert, mit Messparametern, Ergebniswerten und Rohstoff-Chargeninformationen. Diese Datenbank wird nicht in Wochen aufgebaut. In der Praxis bedeutet das: Wer heute ohne Daten startet, hat in zwei Jahren ein trainiertes Modell, sofern die Datendisziplin von Anfang an stimmt. Wer schon eine saubere Datenbasis hat, schafft es in vier bis sechs Monaten (siehe Zeitplan). Alternativ gibt es Kooperationswege mit Datenplattformen, aber auch diese setzen Mindestdatenmengen voraus. Keine andere Anwendung in dieser Kategorie ist so abhängig von einer Datenbasis, die Jahre vorher hätte aufgebaut werden müssen.

ROI-Sicherheit, mittel (3/5) Die Prognosequalität des Modells hängt direkt von der Trainingsdaten-Abdeckung ab. Für gut repräsentierte Emulsionstypen (klassische O/W-Systeme, bekannte Emulgatorfamilien) kann die Vorhersage gut sein; eine Genauigkeitszahl aus einer Studie sagt dir aber wenig über dein Portfolio, dein eigenes Back-Testing sagt alles. Für neue Rohstoffklassen oder unbekannte Kombinations-Räume sinkt die Genauigkeit unvorhersehbar. Der ROI tritt zuverlässig ein, wenn das Modell in seiner Abdeckungszone bleibt, aber die Grenze dieser Zone ist schwer von außen zu erkennen.

Skalierbarkeit, hoch (4/5) Einmal trainiert und validiert läuft ein ML-Stabilitätsmodell marginal kostenlos für jede weitere Formulierungsanfrage. Wer mit drei Produktentwicklungen pro Jahr startet, kann das Modell bei zehn Entwicklungen ohne proportionale Mehrkosten nutzen. Die laufenden Modellpflege- und Retraining-Kosten steigen nicht proportional zum Volumen, sie fallen an, wenn neue Rohstoffklassen eingeführt werden oder wenn das Modell nach einer definierten Anzahl neuer Validierungspunkte nachtrainiert wird.

Richtwerte, stark abhängig von vorhandener Formulierungsdatenbank, Rohstoffportfolio und internem Datenbankmanagement.

Was das ML-Modell konkret macht

Der Kern des Ansatzes: Ein Machine Learning-Modell lernt aus Hunderten historischer Formulierungsversuche, welche Kombination aus Emulgatorsystem, Wirkstoffkonzentration, pH-Wert, Wasseraktivität und Phasenverhältnis zu stabilen Emulsionen führt, und welche nicht.

Die relevanten Eingangsparameter

Für Emulsionen sind das typischerweise:

  • HLB-Wert (hydrophile-lipophile Balance): Gibt an, ob ein Emulgator eher Öl-in-Wasser- oder Wasser-in-Öl-Emulsionen stabilisiert. Werte zwischen 8 und 18 bevorzugen O/W-Emulsionen, unter 6 bevorzugen W/O-Systeme. Das Modell lernt, welche HLB-Kombination aus Haupt- und Co-Emulgator welche Stabilitätsergebnisse produziert.
  • Phasenverhältnis: Der Anteil der Ölphase zur Wasserphase in der Rezeptur bestimmt die Viskosität und Stabilität maßgeblich. Kleine Änderungen (z. B. von 20 auf 30 % Ölphase) können große Stabilitätsauswirkungen haben.
  • pH-Wert und Puffersystem: Viele Emulgatoren und Wirkstoffe haben pH-abhängige Stabilitätsfenster. Das Modell lernt diese Fenster aus historischen Daten.
  • Wirkstoffkonzentrationen: Insbesondere bei aktiven Inhaltsstoffen wie Vitamin C, Retinol oder AHA-Säuren, die chemisch reaktiv sind und das Emulgatorsystem beeinflussen können.
  • Wasseraktivität (aw): Entscheidend für mikrobiologische Stabilität und für die Aktivität mancher Wirkstoffe.

Was das Modell daraus macht

Aus diesen Parametern berechnet das Modell eine Stabilitätsprognose, üblicherweise als Wahrscheinlichkeitswert zusammen mit einem Konfidenzintervall. Moderne Ansätze wie die Plattform Intellico (Produkt: Matilde) nutzen dabei Explainable AI: Sie zeigen nicht nur das Ergebnis, sondern auch, welche Eingabeparameter am stärksten zur Vorhersage beitragen. Für die Formulierungschemikerin bedeutet das: Sie sieht nicht nur “instabil, 78 % Wahrscheinlichkeit”, sondern auch “Haupttreiber: pH-Wert-Emulgator-Wechselwirkung bei diesem Zuckerester-Anteil.”

Welche ML-Modelltypen zum Einsatz kommen

Für Stabilitätsprognosen aus Formulierungsparametern haben sich drei Ansätze etabliert:

  • Random Forests und Gradient Boosting: Gut interpretierbar, robust gegenüber kleinen Datenmengen, funktionieren bereits ab 100–200 historischen Formulierungen. Der Hauptvorteil: Sie zeigen Feature Importances, welche Parameter treiben das Modell am stärksten.
  • Graph Neural Networks (GNNs): Bilden Molekülstrukturen als Graphen ab und erfassen so chemische Zusammenhänge, die tabellarische Daten nicht ausdrücken können. Benötigen mehr Daten, liefern bei ausreichender Datenbasis präzisere Vorhersagen für chemisch komplexe Systeme.
  • QSPR-Modelle (Quantitative Structure-Property Relationship): Der wissenschaftliche Standard aus der chemischen Forschung, mathematische Korrelation zwischen Molekülstruktur und Eigenschaft. Basis vieler akademischer Veröffentlichungen.

Wichtig: Kein Modell kann vollständig erklären, was in einem konkreten Laboransatz passiert. Modelle prognostizieren Wahrscheinlichkeiten auf Basis von Mustern aus Vergangenheitsdaten, kein Ersatz für physikalisch-chemisches Verständnis.

Regulatorische Einbettung: Was das Modell leisten darf und was nicht

Dieser Punkt wird in Marketingmaterialien zu ML-Formulierungstools häufig vage gelassen. Deshalb hier klar:

Was die EU-Kosmetikverordnung 1223/2009 verlangt: Jedes kosmetische Mittel, das auf dem EU-Markt angeboten wird, muss einen Cosmetic Product Safety Report (CPSR) vorweisen. Dieser enthält unter anderem die Stabilitätsdaten des Produkts, physikalisch-chemische Stabilitätsnachweise aus dokumentierten Labortests, keine Modellvorhersagen.

Was ML-Prognosen in diesem Kontext sind: Ein Screening-Werkzeug, kein Zulassungsersatz. Das Modell hilft dabei, vor dem regulatorisch relevanten Labortest die instabilsten Kandidaten auszusortieren. Der Test selbst, mit echten Messungen, dokumentierten Protokollen und einem Sicherheitsbewerter, bleibt Pflicht.

Wo die Stabilitätsdaten landen: Im Sicherheitsbericht nach Anhang I der Kosmetikverordnung, den die sicherheitsbewertende Person verantwortet und den die Überwachungsbehörden der Länder anfordern können. Das CPNP bekommt ihn gar nicht zu sehen. Eine Modellvorhersage ersetzt dort keinen Messwert. Was die Verordnung nicht ausschließt: die Verwendung von Prognosen als interne Entwicklungsunterstützung. Wer sein ML-Modell als internen R&D-Filter dokumentiert, mit Validierungsprotokollen aus Back-Testing auf bekannten Formulierungen, kann das in der internen Entwicklungsdokumentation abbilden.

Die Verbindung zur regulatorischen Pflicht: Ein stabileres Produkt, das den Pflichttest auf Anhieb besteht, ist das Ziel. ML hilft, dahin schneller zu kommen. Die regulatorische Compliance (CPNP-Meldung und EU-Kosmetikverordnung) bleibt ein separater Schritt.

Konkrete Werkzeuge, was wann passt

Intellico (Matilde), sagt Emulsionsstabilität, pH, Viskosität und sensorische Parameter aus Rezepturdaten voraus und nutzt dafür Graph Neural Networks statt klassischer tabellarischer ML-Ansätze. Stärke: Explainable AI zeigt, welche Inhaltsstoffe welche Eigenschaft treiben, für Formulierungschemiker der entscheidende Unterschied zur Black Box. Ein Assistent prüft regulatorische Vorgaben und schlägt alternative Rohstoffe vor, Anbindung an LIMS, PLM und ERP ist möglich. Mailänder Anbieter, EU-Hosting über Azure, englische Oberfläche. Preis auf Anfrage, Demo-basierter Einstieg. Empfehlung: wenn Erklärbarkeit der Vorhersagen intern wichtig ist, etwa gegenüber der Sicherheitsbewertung oder der Geschäftsführung.

ChemCopilot , kein spezialisiertes Werkzeug für Emulsionsstabilität und ohne physikalische Kompatibilitätsprüfung, aber als Formulierungsassistent für Rohstoff-Substitution nützlich: Wenn eine neue biozertifizierte Emulgatoralternative geprüft wird, kann ChemCopilot einen REACH/SVHC-Vorabcheck liefern und strukturähnliche Alternativen mit regulatorischem Screening vorschlagen. Ergänzend zu Intellico, nicht ersetzend.

Uncountable, ELN/LIMS-Plattform mit integrierten ML-Vorhersagefunktionen für die Formulierungsentwicklung. Breiter als die spezialisierteren Kosmetik-Tools: deckt Chemie, Consumer Goods und Food & Beverage ab. Stärke liegt in der engen Verzahnung von Versuchsplanung, Datenerfassung und Vorhersage in einer Plattform. Sinnvoll für Unternehmen, die gleichzeitig ihr Labor-Datenmanagement (ELN) modernisieren wollen. Enterprise-Pricing, kein öffentlicher Listenpreis.

Eigenentwicklung mit Scikit-learn / Python, für Unternehmen mit Datenwissenschafts-Kapazitäten intern ist ein eigenes Modell auf Basis der eigenen Formulierungsdatenbank möglich. Random-Forest- oder XGBoost-Modelle auf 200+ historischen Formulierungen mit Stabilitätsergebnissen liefern solide Basisprognosen. Vorteil: vollständige Datenkontrolle, keine Lizenzkosten. Nachteil: Entwicklungsaufwand, Wartungsbedarf, kein produktionsfertiges Interface.

Zusammenfassung: Wann welcher Ansatz

  • Kosmetikhersteller mit 150+ dokumentierten Formulierungen, EU-Hosting und Erklärbarkeit wichtig → Intellico (Matilde)
  • Gleichzeitig ELN/LIMS-Modernisierung geplant → Uncountable
  • Eigenes Data-Science-Team vorhanden → Eigenentwicklung (Python/Scikit-learn)
  • Regulatorisches Rohstoff-Screening parallel → ChemCopilot

Datenschutz und Datenhaltung

Formulierungsrezepturen sind das Kerngeschäft eines Kosmetikherstellers, oft geschäftskritisches IP, das in keiner Cloud landen sollte, bei der die Datensouveränität unklar ist.

Die DSGVO greift bei Formulierungsdaten nicht im klassischen Sinne (keine personenbezogenen Daten), aber es gelten eigene Schutzanforderungen:

  • Vertragsrechtlicher Schutz (NDA + IP-Klauseln): Jeder SaaS-Anbieter, dem Rezepturdaten übergeben werden, muss vertraglich bestätigen, dass diese Daten nicht für gemeinsame Modelle, Benchmarks oder Anbieter-Produktverbesserungen genutzt werden. Das ist ein Standardpunkt in Enterprise-Verträgen, einfordern und dokumentieren.
  • EU-Hosting: Intellico betreibt EU-seitige Infrastruktur. Das ist für Unternehmen in der EU die erste Anforderung, US-gehostete Formulation-Daten können im Prinzip unter US-Gerichtszuständigkeit landen.
  • On-Premise als Alternative: Für Unternehmen, die jegliche Cloud-Übermittlung von Formulierungsdaten ausschließen, sind selbst gehostete ML-Lösungen (eigenes Python-Modell auf firmeneigenem Server) die sicherste Option, auf Kosten des Komforts und mit Wartungsaufwand.
  • Datenminimierung: Nicht die vollständige Rezeptur muss ins Modell. Feature Engineering erlaubt es, aus Rezepturen abgeleitete Parameter (HLB, pH, Phasenverhältnis) statt der vollständigen Rohstoffliste zu übergeben, das reduziert das Risiko bei gleichem Modellnutzen.

Was es kostet, realistisch gerechnet

Einmalige Projektkosten

AnsatzErstkostenWas du bekommst
Plattform ( Intellico )Geschätzt 20.000–80.000 € Implementierung + Datenprojekt, keine ListenpreiseTrainiertes Modell auf deiner Datenbasis, Interface, Anbindung
Eigenentwicklung (Data Scientist intern)40.000–100.000 € (6–12 Monate Entwicklung)Vollständig kontrolliertes Modell, kein Vendor-Lock-in
Kooperation mit Datenplattform (Uncountable)Auf Anfrage (typisch 30.000–100.000 €/Jahr Enterprise)ELN + Vorhersagemodul + Standardisierte Methodiken

Laufende Kosten

  • Lizenz SaaS-Plattform: 1.500–5.000 €/Monat je nach Volumenlizenz (Schätzung; kein öffentlicher Listenpreis)
  • Eigenentwicklung Wartung: 5–10 % der Erstkosten p.a. für Modellpflege und Retraining
  • Daten-Aufbereitung für Ersttraining: intern 2–4 Wochen Aufwand zur Historisierung bestehender Labordaten

Was du dagegenrechnen kannst

Ein mittelständischer Kosmetikhersteller mit vier Produktentwicklungen pro Jahr. Angenommen, ein gescheiterter Durchlauf kostet ihn 10.000 Euro an Rohstoffen, Laborstunden und Testgebühren; setz deine eigene Zahl ein.

  • Verhindert das Modell je Entwicklung einen Fehlansatz, sind das 4 mal 10.000 Euro, also 40.000 Euro im Jahr.
  • Verhindert es zwei, sind es 80.000 Euro.
  • Dagegen steht die Plattform: 12 mal 1.500 bis 5.000 Euro, also 18.000 bis 60.000 Euro Lizenz im Jahr, dazu einmalig 20.000 bis 80.000 Euro Aufbau.

Mit einem vermiedenen Fehlansatz je Entwicklung liegt das Ergebnis zwischen deutlich positiv und negativ, je nach Lizenz. Mit zwei ist es klar positiv, und der Aufbau ist nach einigen Monaten bis vier Jahren bezahlt. Dazu kommen Monate Durchlaufzeit, die bei festen Listungsterminen viel wert sein können, aber kein Geld auf dem Konto sind. Und das Modell kostet auch etwas, wenn es irrt: Jeder gute Kandidat, den es fälschlich aussortiert, ist eine Rezeptur, die nie ins Labor kommt. Der Hebel hängt also direkt davon ab, wie oft das Modell eine instabile Formulierung korrekt ausschließt und wie selten es eine stabile verwirft.

Wie du den ROI wirklich misst Nicht durch Projektion vor dem Rollout, sondern durch Back-Testing: Lass das Modell auf bekannten historischen Formulierungen laufen und vergleiche, wie viele der dokumentierten Fehlschläge das Modell vorab korrekt als instabil identifiziert hätte. Diese Trefferquote (und die False-Positive-Rate) ist die einzige aussagekräftige Zahl, alles andere ist Spekulation.

Newsletter

Solche Praxis-Analysen, regelmäßig in deinem Postfach

Neue KI-Use-Cases, ehrliche Tool-Tests und DSGVO-Updates, verständlich aufbereitet. Kein Spam, jederzeit abbestellbar.

Mit der Anmeldung stimmst du unserer Datenschutzerklärung zu. Jederzeit abmeldbar.

Was das Modell lernt, und wann es scheitert

Dieser Abschnitt verdient mehr Raum, als ihn die meisten Anbieter-Webseiten einräumen.

Wann das Modell verlässlich ist

Das Modell ist verlässlich innerhalb seiner Trainingsdomäne: für Emulsionstypen, Emulgatorfamilien und Wirkstoffklassen, die in der Trainingsdatenbank gut repräsentiert sind. Wenn du 200 O/W-Emulsionen mit Cetylalkohol-basierten Emulgatorsystemen und verschiedenen Ölphasen-Verhältnissen trainiert hast, wird das Modell neue Variationen in diesem Raum gut prognostizieren.

Wann das Modell scheitert, und warum das gefährlich ist

Das Modell scheitert bei Out-of-Distribution-Kombinationen: neue Rohstoffklassen, die nie zuvor in der Datenbasis aufgetaucht sind, neue Emulgatortechnologien oder Wirkstoff-Wechselwirkungen, die in der Trainingshistorie nicht vorkommen.

Das gefährliche daran: ML-Modelle scheitern nicht still. Sie geben weiterhin Vorhersagen aus, oft mit hoher Konfidenz, auch wenn die Trainingsdaten keine Grundlage für diese Prognose bieten. Ein Gradient-Boosting-Modell, das 500 Lecithin-basierte Formulierungen kennt, wird für eine Formulierung mit einem neuartigen Biopolymer-Emulgator trotzdem eine Stabilitätsprognose ausgeben. Diese Prognose ist strukturell unzuverlässig, aber das Modell signalisiert das nicht automatisch.

Was das konkret bedeutet:

Jedes ML-Stabilitätssystem braucht ein Unsicherheits-Monitoring: Die Frage “Liegt diese neue Formulierung im Abdeckungsbereich des Modells?” muss systematisch gestellt werden, bevor eine Prognose als Entscheidungsgrundlage gilt. Frag bei Plattformen wie Intellico nach, ob und wie sie diese Unsicherheit ausweisen; das Interpretieren bleibt Aufgabe der Formulierungschemikerin, nicht des Tools. Ein Modell, das sagt “Stabilität: 73 %, Konfidenz: hoch”, für eine Formulierung außerhalb seiner Trainingsdomäne, ist gefährlicher als kein Modell.

Praktische Konsequenz: Modell-Vorhersagen für alle Formulierungen mit neuartigen Rohstoffklassen immer durch einen Labortest validieren, unabhängig davon, was das Modell prognostiziert. Die neue Rohstoffklasse liefert gleichzeitig einen neuen Trainingsdatenpunkt für den nächsten Modell-Zyklus.

Typische Einstiegsfehler

1. Das Modell auf zu wenig Daten trainieren und dann vertrauen. Fünfzig historische Formulierungen reichen aus für erste Experimente. Für produktive Entscheidungsunterstützung braucht es mindestens 150–200 Formulierungen mit vollständigen Ergebnisdaten, darunter auch Fehlschläge. Wer nur die “guten” Formulierungen dokumentiert hat, trainiert ein Modell, das nur die Stabilität erfolgreicher Produkte vorhersagt, und Instabilität systematisch unterschätzt.

2. Das Modell als letztes Sicherheitsnetz statt als Vorfilter behandeln. Ein Modell, das eine Formulierung als “stabil” prognostiziert, schließt Instabilität nicht aus. Es sagt: “In meinem Trainingsdaten-Raum sahen ähnliche Formulierungen stabil aus.” Den regulatorisch vorgeschriebenen Labortest kann und darf kein ML-Modell ersetzen. Wer das intern so kommuniziert, vermeidet Enttäuschungen beim ersten Durchfaller einer “modell-validierten” Rezeptur.

3. Die Datenbasis nach dem Modelltraining nicht weiterpflegen. Das häufigste Langzeitproblem: Das Modell wird einmalig trainiert und dann nicht mit neuen Testresultaten gespeist. Nach 12–18 Monaten führt das Team neue Rohstoffe ein und merkt, dass das Modell dafür keine verlässlichen Prognosen mehr liefert, ohne zu wissen, warum. Die Lösung ist organisatorisch, nicht technisch: Jedes neue Labortestresultat muss systematisch in die Trainingsdatenbank zurückfließen. Das muss in die Laborprozesse eingebaut werden, nicht als nachträglicher Schritt.

4. Die Modell-Grenzen nicht intern kommunizieren. Wenn das F&E-Team anfängt, Modellvorhersagen als Fakten zu behandeln, Formulierungen auf Basis einer Modellprognose in die Produktion zu geben, ohne Laborvalidierung, ist ein gefährlicher Grenzbereich erreicht. Das Modell sollte in der internen Kommunikation immer als “Prognose mit bekannter Unsicherheit” bezeichnet werden, nicht als “Stabilitätscheck”.

Was mit der Einführung wirklich passiert

Die technische Seite, Modell trainieren, Interface einrichten, erste Prognosen durchführen, ist in diesem Anwendungsfall überraschend handhabbar. Das Schwierigere ist die Datenseite.

Das Datenbasis-Problem In den meisten Formulierungsabteilungen existieren Stabilitätsdaten in verschiedenen Formaten und Systemen: Excel-Tabellen aus verschiedenen Jahren, Laborberichte als PDFs, Daten in verschiedenen LIMS-Systemen, Ergebnisse aus externen Auftragsanalysen. Das in eine konsistente, ML-trainierbare Struktur zu überführen, ist beim Erstprojekt oft der größte Teil der Arbeit. Unterschätze das nicht.

Widerstand aus dem Labor Formulierungschemiker, die jahrelang durch Erfahrung und Intuition sehr gute Ergebnisse erzielt haben, reagieren verständlicherweise skeptisch auf ein System, das ihre Expertise “automatisieren” soll. Das ist kein irrationaler Widerstand, er hat einen Grund. Was hilft: Das Modell nicht als Ersatz, sondern als Arbeitshilfe positionieren, die repetitive Varianten-Screenings übernimmt, damit mehr Zeit für chemisch komplexe, wirklich neue Problemstellungen bleibt. Und: Das erste Modell gemeinsam mit den Chemikern back-testen, sie sollen das System verstehen, nicht nur das Ergebnis sehen.

Die zweite Hürde: Retraining-Disziplin Das Modell ist nach dem ersten Training gut. Nach zwölf Monaten ohne neue Daten wird es schlechter, wenn neue Rohstoffe eingeführt wurden. Wer keinen definierten Retraining-Rhythmus festlegt, und eine Person benennt, die dafür verantwortlich ist, hat nach zwei Jahren ein veraltetes Modell, das niemand mehr vertraut, und niemand mehr weiß warum.

Realistischer Zeitplan mit Risikohinweisen

PhaseDauerWas passiertTypisches Risiko
Daten-Inventur und -aufbereitungWoche 1–6Historische Stabilitätsdaten aus allen Quellen sichten, normalisieren, Fehlschläge explizit aufnehmenMehr Quellen und Formate als erwartet, die Datenbereinigung frisst mehr Zeit als das Training
Modelltraining und -validierungWoche 6–10Erstes Modell trainieren, Back-Testing auf bekannten Formulierungen, Genauigkeit und False-Positive-Rate dokumentierenGenauigkeit unter Erwartung, weil zu wenige Fehlschläge in der Trainingsdatenbank dokumentiert sind
PilotbetriebWoche 10–16Parallelbetrieb: Modellprognose + klassischer Labortest für dieselben Formulierungen. Abweichungen dokumentieren.Modell ist für bestimmte Emulsionstypen gut, für andere nicht, klare Kommunikation der Anwendungsgrenzen nötig
ProduktivbetriebAb Monat 5Modell als Vorfilter im Entwicklungsprozess. Nur Kandidaten mit guter Prognose kommen in den Labortest. Alle neuen Testergebnisse zurück in die Datenbasis.Retraining-Rhythmus nicht etabliert, Modell veraltet ohne feste Zuständigkeit und Trigger

Wichtig: Vier bis sechs Monate bis zum Produktivbetrieb ist realistisch, nicht als Projektverzögerung, sondern als strukturelle Anforderung für eine belastbare Datenbasis und ein validiertes Modell.

Häufige Einwände, und was dahintersteckt

„Wir haben keine historischen Stabilitätsdaten in auswertbarer Form.” Das stimmt oft. Es stimmt aber auch oft halb: Die Daten existieren, sind aber über Excel-Tabellen, Labor-Notizbücher, PDFs und alte LIMS-Systeme verteilt. Das Projekt beginnt dann nicht mit Modelltraining, sondern mit Daten-Inventur. Das ist ein echter Aufwand, aber er entsteht nicht durch das ML-Projekt, sondern er war schon immer vorhanden. Das Modell ist oft nur der Anlass, die Datenbasis endlich in Ordnung zu bringen.

„Unser Produktportfolio ist zu speziell, da wird kein Modell ausreichend Trainingsdaten haben.” Das ist die ehrlichste Gegenrede, die es gibt. Wenn ein Unternehmen ausschließlich ein- bis zweimal pro Jahr hochspezialisierte Formulierungen entwickelt, die keine gemeinsame Basis mit dem bisherigen Portfolio haben, ist der ML-Ansatz unrealistisch. Dann ist klassische Formulierungsexpertise oder eine Zusammenarbeit mit dem Anwendungslabor deines Emulgator-Lieferanten oder einem Forschungsinstitut zielführender.

„Der regulatorische Stabilitätstest kommt sowieso, was spare ich wirklich?” Wenn das Modell trifft, sparst du die Iterationen vor dem Test. Braucht ein Unternehmen heute drei Testdurchläufe und mit Vorfilter zwei, fällt ein Durchlauf von drei bis sechs Monaten weg. Ob es zwei, einer oder keiner ist, zeigt nur das Back-Testing auf deinen eigenen Daten.

„Wir sind zu klein für so ein Projekt.” Wahrscheinlich richtig, wenn “zu klein” bedeutet: unter 100 dokumentierte Stabilitätstests mit Ergebnis, unter drei Produktentwicklungen pro Jahr, kein internes Dateningenieur-Profil. Dann ist die sinnvollere Investition zunächst in eine systematische Labordaten-Dokumentation, und in zwei Jahren, wenn die Datenbasis steht, neu prüfen.

Woran du merkst, dass das zu dir passt

Das passt zu dir, wenn:

  • Ihr habt eine systematisch dokumentierte Formulierungshistorie, besser 150 bis 200 Formulierungen mit Stabilitätsergebnissen in auswertbarer Form, mindestens aber 100. Auch Fehlschläge.
  • Ihr entwickelt drei oder mehr neue Produkte pro Jahr, der ROI tritt erst ein, wenn das Modell regelmäßig eingesetzt wird.
  • Ihr habt in den letzten Jahren regelmäßig Fehlansätze gehabt, die nach 3–6 Monaten Labortest gescheitert sind, das ist die Zielscheibe des Modells.
  • Ihr wechselt auf neue Emulgatortechnologien (Bio-Emulgatoren, Green Chemistry) und habt noch keine Erfahrungsbasis dafür, genau hier kann ein Modell auf Basis ähnlicher Systeme orientieren.
  • Ihr habt einen internen Data Scientist oder Laborinformatik-Spezialisten, der das Modell betreuen kann, oder ihr arbeitet mit einem Anbieter zusammen, der das übernimmt.

Harte Ausschlusskriterien, wann du es sein lassen solltest:

  1. Unter 100 dokumentierten historischen Stabilitätstests mit Ergebnisangaben. Darunter ist kein ML-Modell trainierbar, das zuverlässige Prognosen liefert. Zuerst Datenbasis aufbauen, dann Modell.

  2. Weniger als drei neue Produkte pro Jahr. Der Aufwand für Modellaufbau und -pflege ist nicht durch den Nutzen gedeckt. Klassische Formulierungsexpertise und ggf. externe Beratung sind effizienter.

  3. Alle neuen Formulierungen nutzen Rohstoffklassen, die in der bisherigen Datenbasis nicht vorkommen (z. B. kompletter Wechsel von konventionellen zu 100 % bio-basierten Emulgatoren ohne historische Vergleichsdaten). Das Modell würde außerhalb seiner Trainingsdomäne arbeiten und hätte keine zuverlässige Vorhersagekraft, im schlimmsten Fall schafft das falsche Sicherheit.

Das kannst du heute noch tun

Beginne mit einer Datenbasis-Inventur, bevor irgendein Tool evaluiert wird.

Öffne eure Labordaten-Ablage und beantworte diese Fragen:

  • Wie viele abgeschlossene Stabilitätstests existieren in dokumentierter Form, mit Ergebnisangabe?
  • Sind Fehlschläge ebenso systematisch dokumentiert wie Erfolge?
  • In welchem Format liegen diese Daten: Excel, LIMS, PDF, Labor-Notizbuch?
  • Wer kennt die Daten gut genug, um Lücken und Widersprüche zu erkennen?

Diese Inventur gibt dir in zwei Stunden mehr Klarheit darüber, ob ein ML-Projekt realistisch ist, als jede Anbieter-Demo.

Danach: Lass dir von Intellico eine Demo mit deinen eigenen Beispieldaten zeigen, und frage explizit nach dem Back-Testing: Wie gut prognostiziert das Modell bekannte historische Ergebnisse aus deiner Datenbasis? Diese Zahl ist der einzige valide Startpunkt für eine ROI-Bewertung.

Für den ersten internen Daten-Audit kannst du diesen Prompt als Strukturhilfe nutzen:

Daten-Inventur für ML-Stabilitätsprojekt
Du hilfst mir bei der Inventur unserer historischen Kosmetik-Stabilitätsdaten für ein ML-Projekt. Ich beschreibe dir, was wir haben: [BESCHREIBUNG DER VORHANDENEN DATENQUELLEN: z.B. "Excel-Tabellen aus Labortests 2018–2025, ca. 80 Einträge; 3 externe LIMS-Exporte; 20 Stabilitäts-PDFs von Auftragsanalysen"] Erstelle daraus eine strukturierte Datenaudit-Checkliste mit folgenden Fragen: 1. Welche Pflichtfelder braucht ein ML-Modell für jede Formulierung? (Emulgatorsystem, HLB, Phasenverhältnis, pH, Testbedingungen, Ergebnis) 2. Wie viele unserer Datenpunkte sind wahrscheinlich vollständig verwertbar? 3. Welche Lücken müssen für ein ML-Training zuerst geschlossen werden? 4. Wie viele Fehlschläge sind dokumentiert vs. nur Erfolge? 5. Was ist der realistische nächste Schritt: Eigenes Modell bauen, SaaS-Plattform evaluieren oder zuerst Datenbasis aufbauen? [DEINE SPEZIFISCHEN ROHSTOFFKLASSEN ODER EMULSIONSTYPEN, z.B. "O/W-Emulsionen, Bio-Emulgatoren, Naturkosmetik COSMOS-Standard"]
Funktioniert mit ChatGPT, Claude, Gemini
Beispiel-Ausgabe

Mitarbeiter:in

Wir haben ca. 120 Excel-Einträge aus 2019–2025, aber nur bei 60 davon sind Fehlschläge dokumentiert. Schwerpunkt sind O/W-Emulsionen mit Lecithin und Zuckerester-Systemen. 15 Formulierungen mit neuen Polyglyceryl-Emulgatoren seit 2023.

KI-Assistent

Datenbasis-Bewertung für ML-Stabilitätsprojekt: **Verwertbare Datenpunkte:** ~60–80 (Schätzung: vollständig dokumentierte Einträge mit Ergebnis und Fehlschlag-Information), also rund die Hälfte bis zwei Drittel der Daten. **Lücken:** • 60 Einträge ohne Fehlschlag-Dokumentation → Kritisch: Ein Modell, das nur Erfolge sieht, unterschätzt Instabilität systematisch. Priorität: Fehlschläge aus Laborberichten und Protokollen nacherfassen. • 15 Polyglyceryl-Formulierungen → Zu wenig für eine eigenständige Subdomäne. Diese Klasse wird das Modell nicht verlässlich abdecken. **Pflichtfelder pro Eintrag (zum Nacherfassen):** Emulgatorsystem + Konzentration, Ölphasen-Anteil, pH-Zielwert, Testbedingungen (40°C/8Wochen, Zentrifuge, Freeze-Thaw-Zyklen), Ergebnis (stabil/instabil/phasentrennung). **Empfehlung:** 60–80 vollständige Einträge liegen unter der Schwelle von etwa 100, ab der ein Modell überhaupt belastbar wird, und deutlich unter den 150–200 für den produktiven Einsatz. Deshalb vor jeder Plattform-Evaluation 4–6 Wochen Daten-Nacherfassung: Fehlschläge aus Laborberichten und Protokollen nachtragen. Ein Back-Test mit einem Anbieter ergibt erst danach Sinn. Polyglyceryl-Klasse vorerst aus dem Modell-Scope ausschließen und manuell validieren. **Realistischer nächster Schritt:** Datenbereinigung vor Modellevaluierung, kein Tool kann schlechte Trainingsdaten kompensieren.

Quellen & Methodik

  • L’Oréal und IBM AI Formulation Partnership (Januar 2025): Gemeinsames KI-Grundmodell für Rezepturdaten, ohne veröffentlichte Zahlen zu eingesparten Entwicklungsrunden. Quelle: BeautyMatter, „L’Oréal Groupe and IBM’s AI Formulation Breakthrough” (21.01.2025), https://beautymatter.com/articles/loreal-groupe-and-ibms-ai-formulation-breakthrough
  • Überblick ML in der Kosmetikformulierung: Chemical Papers, Springer Nature, „Advances in the applications of machine learning for cosmetic formulation development” (Übersichtsartikel, 2026), https://link.springer.com/article/10.1007/s11696-026-04696-7
  • EU-Kosmetikverordnung 1223/2009: Stabilitätsdaten als Pflichtbestandteil des Sicherheitsberichts (CPSR), Anhang I. Verordnung (EG) Nr. 1223/2009.
  • Kosten je Fehlansatz und Plattformpreise: keine belastbare öffentliche Quelle; die Rechnung arbeitet mit Annahmen, die du durch deine eigenen ersetzt
  • QSPR-Modelle für Emulsionsvorhersage: Wissenschaftliche Grundlage für quantitative Struktur-Eigenschafts-Beziehungen. Quelle: MDPI Cosmetics, „Artificial Intelligence in Cosmetic Formulation” (2025), https://www.mdpi.com/2079-9284/12/4/157
  • Intellico Matilde: Explainable AI für Kosmetikformulierungen mit Graph Neural Networks, EU-Hosting; unsere Toolseite (geprüft Juni 2026) und die Anbieterwebseite https://intellico.ai/predictive-ai-for-cosmetics-beauty-formulation/ (verifiziert Mai 2026)

Du willst wissen, ob eure Formulierungsdatenbank ausreicht und wie ein ML-Pilotprojekt für euren Produktmix aussehen würde? Meld dich, das klären wir in einem kurzen Gespräch.

Diesen Inhalt teilen:

🤝

Du weißt jetzt, was möglich ist. Fehlt noch die Umsetzung?

Viele, die diesen Use Case lesen, versuchen es danach allein. Das kostet Wochen: Datenschutzfragen, Toolauswahl, Prompt-Engineering, interne Überzeugungsarbeit. Wir kennen diese Stolperstellen, weil wir das Setup schon gebaut haben. Schreib uns kurz, das Erstgespräch ist kostenlos und unverbindlich.

Deine Daten werden ausschließlich zur Bearbeitung deiner Anfrage verwendet (Art. 6 Abs. 1 lit. b DSGVO). Mehr in unserer Datenschutzerklärung.

Frieda Funke

Konzeptentwicklerin

Ich frage nicht, was KI kann. Ich frage, was du in deinem Alltag damit anfängst. Erst wenn ich eine ehrliche Antwort habe, entsteht daraus ein konkreter Use Case. Fehlt ein Anwendungsfall, der zu dir passt? Schreib mir kurz.

Kostenloser Newsletter

Bleib auf dem neuesten
Stand der KI

Wähle deine Themen und erhalte relevante KI-News, Praxistipps und exklusive Inhalte direkt in dein Postfach – kein Spam, jederzeit abmeldbar.

Was interessiert dich? Wähle 1 bis 4 Themen, du bekommst nur Inhalte dazu.

Mit der Anmeldung stimmst du unserer Datenschutzerklärung zu. Jederzeit abmeldbar.

Kostenlos
Kein Spam
Jederzeit abmeldbar