„Nicht auszuschließen“: OpenAI, Ihre Forschungs-Prompts und das Labor nebenan

Als OpenAI am 8. September 2026 verkündete, seine Agenten hätten ein Millennium-Problem zu den Navier-Stokes-Gleichungen gelöst, hatte der Mathematiker, der denselben Weg verfolgte, monatelang seine Entwürfe in OpenAIs Codex geschrieben. In der ersten Fassung von OpenAIs Beitrag stand, wie Fortune und TechCrunch zitierten: „While unlikely, we cannot rule out that de-identified data derived from their usage of our products helped improve our models.“ Also: unwahrscheinlich, aber nicht auszuschließen, dass de-identifizierte Nutzungsdaten der beiden die Modelle verbessert haben. Zwei Tage später ersetzte eine interne Prüfung den Satz durch ein klares Dementi. Für ihn ist die Frage damit beantwortet. Für alle anderen, die Forschung und Entwicklung in einen Chatbot tippen, bleibt der erste Satz die ehrliche Antwort.
Die Sicht von Rogue AI: De-Identifizierung schützt Ihren Namen, nicht Ihre Idee. Das Training erledigt die Extraktion, niemand im Labor muss Ihren Chat je lesen. Und das Labor am anderen Ende betreibt inzwischen eigene Forschung an offenen Problemen. Wenn Ihr Unternehmen an der Spitze forscht, ist Ihr KI-Anbieter zum möglichen Konkurrenten geworden, und die Standardeinstellungen privater Konten schicken ihm Ihre Arbeit.
Was ist zwischen Buckmaster, Alpöge und OpenAI passiert?
Tristan Buckmaster, Mathematikprofessor an der NYU, und Levent Alpöge, Mitarbeiter von Anthropic, arbeiteten privat an einem Programm zum erzwungenen Blowup in Strömungsgleichungen. In seiner öffentlichen Stellungnahme schreibt Buckmaster, sie hätten Claude und OpenAIs Codex genutzt, die Werkzeuge aus seinen eigenen Forschungsmitteln bezahlt und am 15. August Blowup-Ergebnisse für Boussinesq und Euler erzielt. Laut OpenAI begann die eigene Arbeit am 1. September, nachdem man von einem Gerücht gehört hatte, das man später den beiden zuordnete. Eine Gruppe von rund 10.000 parallel laufenden Agenten kam am 5. September zum Navier-Stokes-Ergebnis, etwa 88 Stunden nach dem Start.
In einem Gespräch am 6. September fragte Buckmaster nach eigener Darstellung, ob das Modell mit ihren Codex-Sitzungen trainiert worden sei oder Zugriff darauf gehabt habe, „into which we had been putting all our drafts for the whole of this project“, also mit sämtlichen Entwürfen des gesamten Projekts. Man sagte ihm, das Modell schlage keine Nutzerdaten nach. Auf die zweite Frage nach dem Training bekam er keine Antwort. OpenAI erklärt, weder Forscher noch Agenten hätten die Arbeit der beiden vor der Veröffentlichung gesehen, und der eigene Beweis unterscheide sich deutlich. Rogue AI nimmt das so hin. Dieser Beitrag handelt von allen, die nie eine Untersuchung bekommen.
Zwei Fassungen eines Absatzes
OpenAIs Navier-Stokes-Beitrag trägt eine Fußnote: Am 10. September 2026 habe man den Abschnitt „Concurrent work“ mit den Ergebnissen einer Untersuchung aktualisiert, ob Nutzereingaben das Resultat beeinflusst haben könnten. Die beiden Fassungen sagen über das Training mit Nutzerdaten sehr Verschiedenes.
| Fassung | Was OpenAI zum Training sagte | Was es dazu brauchte |
|---|---|---|
| Erstfassung, 8. September | Unwahrscheinlich, aber nicht auszuschließen, dass de-identifizierte Nutzungsdaten die Modelle verbessert haben (zitiert von Fortune) | Nichts. Das ist die Antwort vor jeder Prüfung. |
| Aktualisiert, 10. September | Buckmasters Codex-Prompts der vorangegangenen zwei Monate „could not have influenced the system in any way, including through training“ (OpenAI) | Ein namentlich bekannter Mathematiker, eine öffentliche Stellungnahme und ein Presseecho |
Die neue Fassung nennt auch den Grund: Das interne Modell sei durch großangelegtes Reinforcement Learning auf einem bereits vortrainierten Modell entstanden. Das ist ein konkretes Argument über ein Modell und einen Nutzer in einem Zeitraum von zwei Monaten. Über den allgemeinen Weg von Produktdaten in Modelle sagt es nichts. Der Satz, der den allgemeinen Mechanismus einräumte, dass de-identifizierte Nutzungsdaten Modelle verbessern, ist der, den OpenAI gestrichen hat.
Warum schützt „de-identifiziert“ Ihre Forschung nicht?
De-Identifizierung trennt Daten von einer Person. OpenAIs eigene Hilfeseite beschreibt es genau so: Bevor Nutzerinhalte ins Training gehen, unternehme man Schritte, um den Anteil personenbezogener Informationen in den Trainingsdaten zu verringern. Personenbezogen sind Ihr Name, Ihre E-Mail-Adresse, Ihr Arbeitgeber. Eine Beweisstrategie ist nicht personenbezogen. Ein Syntheseweg auch nicht, ebenso wenig ein Kniff im Chip-Layout oder der Grund, warum Ihre letzten drei Prototypen gescheitert sind.
Wer den Namen entfernt, lässt die Idee im Datensatz, und um die Idee geht es einem Wettbewerber. Ein Modell muss nicht wissen, wer eine Idee hatte, um besser darin zu werden, sie hervorzubringen. Kein Mitarbeiter muss ein Log öffnen und Ihren Chat lesen. Die Extraktion passiert in den Gewichten, und sie kommt bei dem wieder heraus, der als Nächstes die richtige Frage stellt, die eigenen Agenten des Labors eingeschlossen. Ob das im Einzelfall geschehen ist, lässt sich von außen kaum beweisen. Deshalb war „nicht auszuschließen“ die ehrliche erste Antwort.
Trainiert OpenAI standardmäßig mit Ihren Prompts?
Bei privaten Konten ja, solange niemand es abschaltet. Bei Geschäftsverträgen nein, solange niemand es einschaltet. An dieser Trennlinie hängt für die meisten Unternehmen alles, und sie verläuft Konto für Konto. So stand es am 1. Oktober 2026 auf OpenAIs Hilfeseite und der Seite zum Enterprise-Datenschutz:
| Kontotyp | Standard | Der Haken |
|---|---|---|
| ChatGPT und Codex für Einzelpersonen | Darf fürs Training genutzt werden | Der Widerspruch gilt für neue Unterhaltungen. Ein Daumen hoch oder runter kann die ganze Unterhaltung trotzdem ins Training schicken. |
| Codex-Umgebungen | Eigene Einstellung „Include environments“ | Die ChatGPT-Einstellung ändert an dieser nichts. |
| ChatGPT Business, Enterprise, Edu und die API | Kein Training | Außer der Kunde stimmt ausdrücklich zu, etwa über das Teilen von Feedback. |
Beachten Sie, wo Buckmaster stand. Seine Zusammenarbeit war nach eigenen Worten frei von jeder institutionellen Vereinbarung, die Werkzeuge bezahlte er aus seinen eigenen Forschungsmitteln. Seine Einstellungen kennen wir nicht, und OpenAI sagt, seine Prompts hätten keine Rolle gespielt. Die Konstellation ist trotzdem die, die Sie beschäftigen sollte: ein erfahrener Forscher, der die wichtigste Arbeit seiner Laufbahn mit einem Werkzeug erledigt, das außerhalb jedes Firmenvertrags gekauft wurde. Jede Entwicklungsabteilung hat solche Leute, und kaum einer von ihnen hat je das Menü für die Datenkontrolle geöffnet.
Ihr KI-Anbieter arbeitet jetzt in Ihrem Feld
Lesen Sie, wie OpenAI selbst den Beginn schildert. Auf Gerüchte hin, zwei Millennium-Probleme seien gelöst, habe man einen Großversuch gestartet, um das Modell an allen offenen Millennium-Problemen und einigen weiteren wichtigen Problemen zu testen. Über alle Probleme hinweg schickten die Agenten 4,9 Millionen Nachrichten. Das ist ein Labor mit einem Modell, einem Rechenbudget und einem Grund, Erster zu sein, angesetzt auf die schwersten offenen Fragen, die es finden kann. Im September war es Mathematik. An der Methode ist nichts, was sie auf Mathematik beschränkt.
In der Mathematik hat man das kommen sehen. Am 3. September, vor beiden Ankündigungen, warnte Terence Tao unter Berufung auf Hugo Duminil-Copin: Das wahllose, automatisierte Abbauen offener Probleme könne das Ökosystem zerstören, aus dem die nächste Generation mathematischer Techniken, Probleme und Fachleute hätte entstehen sollen. Setzen Sie Ihre Produkt-Roadmap an die Stelle der mathematischen Techniken, und der Satz stimmt immer noch. Ihr Anbieter verkauft nicht mehr nur die Schaufeln. Er gräbt selbst.
Was sollte ein Unternehmen mit echter Forschung ändern?
Behandeln Sie die Trainingsfrage als Vertragsfrage. Ein privater Widerspruch ist eine Einstellung, die ein einzelner Mitarbeiter vergessen kann, und ein Feedback-Klick hebelt sie für diese Unterhaltung aus. Ein Geschäftsvertrag, der Training standardmäßig ausschließt, ist das Minimum für alles, was Sie nicht veröffentlichen würden. Die Position von Rogue AI zum Rest:
- Nach Ideen klassifizieren, nicht nach Personendaten. Ihre Datenschutzrichtlinie wurde für Namen und Adressen geschrieben. Was hier schadet, sind unveröffentlichte Methoden, und die kommen in den meisten Richtlinien gar nicht vor.
- Kronjuwelen auf Modellen, die Sie selbst kontrollieren. Für die wenigen Projekte, die Sie ruinieren würden, wenn ein Wettbewerber zuerst fertig wird, sind die Kosten fürs Selbst-Hosting eine günstige Versicherung. Ein Open-Weight-Modell auf eigener Hardware hat niemanden, an den es etwas zurückschicken könnte, und ein privates KI-Pilotprojekt ist in wenigen Wochen machbar.
- Kaufen Sie die Werkzeuge, die Ihre besten Leute ohnehin nutzen. Ein Chatbot-Verbot treibt Forscher auf private Konten mit eingeschaltetem Training. Die Business-Lizenz kostet weniger als eine verlorene Idee.
Warum das wichtig ist
Buckmaster bekam eine klare Antwort, weil er ein bekannter Mathematiker ist, der seine Sicht veröffentlicht hat und Berichte von TechCrunch bis Fortune auslöste. Ihre Ingenieure bekommen diese Untersuchung nicht. Bringt ein Labor etwas heraus, das wie ihre unveröffentlichte Arbeit aussieht, dann bekommen sie die Antwort, die OpenAI zuerst geschrieben hat, bevor es nachgesehen hatte.
Die Labore verstecken nichts davon. Es steht auf ihren Hilfeseiten und stand zwei Tage lang in einem Blogbeitrag. Das Risiko tragen die Unternehmen, die „de-identifiziert“ lesen und „sicher“ verstehen. Wenn Ihr Vorsprung eine Idee ist, die noch niemand veröffentlicht hat, legen Sie jetzt fest, welche Modelle sie sehen dürfen, so wie Sie längst festlegen, wo Ihre Daten liegen dürfen.
Weiterführende Lektüre
- Selbst gehostete KI vs. Cloud-APIs zu Kosten, Datenschutz und Kontrolle.
- EU-Datensouveränität für KI dazu, wohin Ihre Daten dürfen.
- Ein privates KI-Pilotprojekt, Woche für Woche zum Umzug sensibler Arbeit auf den eigenen Stack.
- OpenAIs Staatsbeteiligung dazu, wer bei Ihrem Datenempfänger noch mitredet.
- Gemini hackte drei Firmen dazu, wie Labore selbst entscheiden, was als Vorfall zählt.
Kurzreferenz
Trainiert OpenAI mit Ihren Eingaben? Standardeinstellungen, Stand 1. Oktober 2026
| Kontotyp | Standard beim Training | Der Haken |
|---|---|---|
| ChatGPT und Codex für Einzelpersonen | Darf fürs Training genutzt werden | Der Widerspruch gilt für neue Unterhaltungen; ein Daumen hoch oder runter kann die ganze Unterhaltung trotzdem ins Training schicken |
| Codex-Umgebungen | Eigene Einstellung „Include environments“ | Die ChatGPT-Einstellung ändert sie nicht |
| ChatGPT Business, Enterprise, Edu und die API | Kein Training | Außer der Kunde stimmt ausdrücklich zu, etwa über das Teilen von Feedback |
Häufig gestellte Fragen
Was sagte OpenAI zum Training mit Tristan Buckmasters Daten?
In der ersten Fassung von OpenAIs Navier-Stokes-Beitrag vom 8. September 2026, zitiert von Fortune und TechCrunch, hieß es, es sei unwahrscheinlich, aber nicht auszuschließen, dass de-identifizierte Nutzungsdaten der beiden Forscher die Modelle verbessert haben. Am 10. September aktualisierte OpenAI den Abschnitt nach einer Untersuchung: Buckmasters Codex-Prompts der vorangegangenen zwei Monate hätten das System auf keine Weise beeinflussen können, auch nicht durch Training, weil das interne Modell per Reinforcement Learning auf einem bereits vortrainierten Modell entstand.
Trainiert OpenAI mit meinen ChatGPT- oder Codex-Prompts?
Bei ChatGPT und Codex für Einzelpersonen darf OpenAI laut eigener Hilfeseite Ihre Inhalte zum Training nutzen, solange Sie nicht „Improve the model for everyone“ abschalten oder im Privacy Portal „Do not train on my content“ wählen. Feedback wie ein Daumen hoch oder runter kann die ganze Unterhaltung trotzdem ins Training schicken. ChatGPT Business, Enterprise, Edu und die API werden standardmäßig nicht fürs Training genutzt.
Schützen de-identifizierte Daten vertrauliche Forschung?
De-Identifizierung entfernt personenbezogene Angaben wie Namen und Kontaktdaten. Den Inhalt der Idee entfernt sie nicht: Eine Methode, eine Beweisstrategie oder eine Designentscheidung bleibt in den Daten. Ein damit trainiertes Modell kann besser darin werden, ähnliche Ideen hervorzubringen, ohne dass jemand weiß, von wem sie stammen. De-Identifizierung ist deshalb Datenschutz, kein Schutz von Geschäftsgeheimnissen.
Wie schützen Unternehmen ihre Forschung vor dem Training von KI-Modellen?
Als Vertragsfrage statt als Nutzereinstellung: Für alles Unveröffentlichte Business-Tarife nutzen, die Training standardmäßig ausschließen, Material nach dem Wert der Idee einstufen statt nur nach Personendaten, und die wenigen Kronjuwelen-Projekte auf selbst betriebenen Modellen laufen lassen. Freigegebene Werkzeuge verhindern außerdem, dass Forscher sensible Arbeit auf private Konten verlagern.