
Illustration Absmeier foto ki designer
Eine neue Studie legt nahe, dass KI-gestützte Bewerbungsscreenings anfälliger für verdeckte Stilpräferenzen sind als bisher angenommen [1]. Für Unternehmen bedeutet das: Wer LLMs in HR-Prozessen einsetzt, muss nicht nur Effizienzgewinne betrachten, sondern auch Fairness, Nachvollziehbarkeit und regulatorische Risiken aktiv steuern.
Management Summary
Das Arbeitspapier macht ein bislang unterschätztes Risiko im KI-gestützten Recruiting sichtbar: Automatisierte Screening-Systeme bewerten Bewerbungen nicht nur nach Qualifikation, sondern reagieren messbar auf Stil, Struktur und Herkunft der KI-generierten Formulierungen. Für Management, HR und Compliance entsteht daraus ein klarer Handlungsauftrag: KI-Auswahlprozesse müssen überprüfbar, erklärbar und regelmäßig auf verdeckte Verzerrungen getestet werden.
- KI-Recruiting braucht neue Kontrollmechanismen: Die Studie zeigt Einstellungsunterschiede von bis zu 42 Prozentpunkten bei identischen Kandidatenprofilen — ausgelöst allein durch unterschiedliche KI-Schreibstile.
- Bias entsteht nicht nur durch Daten, sondern auch durch Formate: Lebenslaufstruktur, Tonalität und sprachliche Muster können automatisierte Bewertungssysteme beeinflussen, obwohl die fachliche Substanz gleich bleibt.
- Tool-Zugang kann zum Karrierefaktor werden: Wer das »richtige« KI-Tool nutzt, könnte im Screening einen Vorteil haben — ein relevantes Risiko für Chancengleichheit und Employer Governance.
- HR-Verantwortliche müssen LLM-Screener auditieren: Unternehmen sollten KI-gestützte Vorauswahl regelmäßig mit kontrollierten Testprofilen, Stilvarianten und Modellvergleichen prüfen.
- Regulierung und Transparenz gewinnen an Bedeutung: Die Ergebnisse stützen die Forderung nach nachvollziehbaren KI-Entscheidungen, belastbarer Dokumentation und klaren Verantwortlichkeiten im Recruiting-Prozess.
Analyse: Was die Ergebnisse für Entscheider bedeuten
Die Studie zeigt vor allem eines: In automatisierten Bewerbungsverfahren zählt offenbar nicht nur, was in einem Lebenslauf steht, sondern auch, wie er formuliert ist. Wenn der gleiche Bewerber je nach verwendetem KI-Schreibtool deutlich unterschiedlich bewertet wird, entsteht ein neues Fairness-Problem. Nicht die Qualifikation verändert sich, sondern die sprachliche Verpackung.
Besonders bedeutsam ist die gefundene Lücke von bis zu 42 Prozentpunkten bei Einstellungsentscheidungen. Für Bewerberinnen und Bewerber kann das praktisch bedeuten: Zwei Personen mit identischem Profil könnten allein deshalb unterschiedlich gute Chancen haben, weil ihre Lebensläufe von unterschiedlichen KI-Systemen geschrieben wurden. Damit würde der Zugang zu bestimmten Tools oder Schreibstilen unbeabsichtigt zu einem Vorteil im Auswahlprozess.
Auch für Unternehmen ist das Ergebnis relevant. Wer KI zur Vorauswahl von Bewerbungen einsetzt, kann sich nicht allein darauf verlassen, dass die Systeme objektiv auf Kompetenzen achten. Die Ergebnisse legen nahe, dass KI-Screener bestimmte Formulierungs- und Strukturmuster bevorzugen können — möglicherweise sogar solche, die von bestimmten anderen KI-Modellen erzeugt wurden. Das kann zu Verzerrungen führen, die im normalen Prüfprozess schwer zu erkennen sind.
Die zentrale Schlussfolgerung lautet daher: KI im Recruiting sollte nicht nur technisch funktionieren, sondern regelmäßig auf faire und nachvollziehbare Entscheidungen überprüft werden. Unternehmen brauchen Tests, die nicht nur offensichtliche Diskriminierung erfassen, sondern auch subtilere Effekte wie Stilpräferenzen, Selbstähnlichkeit zwischen Modellen oder die Bevorzugung bestimmter KI-generierter Formate.
|
Key Fact |
Bis zu 42 Prozentpunkte Unterschied bei Einstellungsentscheidungen trotz identischer Kandidatenprofile. |
|
Risiko |
Stil, Format und KI-Herkunft eines Lebenslaufs können automatisierte Bewertungen messbar beeinflussen. |
|
Management-Aufgabe |
HR, IT, Legal und Geschäftsführung müssen KI-Auswahlprozesse gemeinsam auditieren und dokumentieren. |
KI im Recruiting: Wenn der Schreibstil über Karrierechancen entscheidet
Ein neues Arbeitspapier analysiert 1.576 LLM-Bewertungsentscheidungen und zeigt: Identische Kandidaten können je nach KI-generiertem Lebenslauf deutlich unterschiedliche Einstellungsraten erzielen.
Ein neu veröffentlichtes Arbeitspapier liefert nach Darstellung von Christopher Ort den ersten systematischen empirischen Test einer Frage von wachsender rechtlicher und wirtschaftlicher Bedeutung: Verändert das KI-Modell, das einen Lebenslauf schreibt, messbar das Ergebnis, wenn ein anderes KI-Modell ihn prüft? [1]
Das Paper »The Style Penalty: How AI Resume-Writing Tools Shape Outcomes in Automated Hiring Screens: An Empirical Analysis of 1,576 LLM Evaluation Decisions Across Four Frontier Models« wurde von Christopher Ort (i10X Global Pte Ltd) verfasst und ist auf SSRN in den Forschungsnetzwerken Economics of Networks, Innovation & Management Science sowie Information Systems & Economics veröffentlicht (JEL-Codes J24, M51, O33, C93).
Methode: Kontrolliertes Versuchsdesign statt Anekdote
Ein Großteil der bisherigen öffentlichen Diskussion über Bias bei KI-gestützten Einstellungsverfahren stützt sich auf Einzelfälle oder selbstberichtete Anekdoten. Dieses Paper verwendet stattdessen ein kontrolliertes, vollständig gekreuztes Versuchsdesign, das darauf ausgelegt ist, den Schreibstil als Variable zu isolieren, während die inhaltliche Substanz der Kandidaten konstant gehalten wird:
- 100 synthetische Kandidatenprofile, realistisch konstruiert, über 12 Branchen und vier Karrierestufen hinweg, jeweils passend zu einer maßgeschneiderten Stellenausschreibung
- 4 Modelle zum Verfassen von Lebensläufen — GPT-5.4, Claude Sonnet 4.6, Gemini 3 Pro und xAI Grok 4.3 — erstellten jeweils pro Profil einen funktional identischen Lebenslauf, der sich nur in Sprache, Struktur und Formulierung unterschied
- 400 Lebensläufe insgesamt, jeweils blind von allen vier Modellen als Einstellungs-Screener bewertet
- 576 gültige Bewertungen erhoben — 98,5 % der 1.600 theoretisch möglichen Datenpunkte — bewertet anhand eines kontinuierlichen Fit-Scores von 0 bis 100 sowie einer kategorischen Empfehlung: einstellen / vielleicht / ablehnen
So entsteht ein Datensatz, der groß genug ist, um echten Evaluator-Bias von statistischem Rauschen zu trennen und Effektgrößen statt isolierter Beispiele zu berichten.
Ergebnisse: Was die Daten zeigen
- Eine Einstellungsraten-Lücke von 42 Prozentpunkten bei demselben zugrunde liegenden Kandidaten, allein darauf zurückzuführen, welches Modell den Lebenslauf verfasst hatte.
- Eine Fit-Score-Differenz von 29 Punkten zwischen zwei bewertenden Modellen, die exakt dasselbe Dokument lasen.
- Ein messbarer Selbstpräferenz-Effekt: Claude Sonnet 4.6 empfahl den eigenen Schreibstil in 84 % der Fälle zur Einstellung, gegenüber 42 % bei GPT-verfassten Lebensläufen desselben Kandidaten.
- Ein gegenteiliger negativer Selbstbias: GPT-5.4 bewertete den eigenen Schreibstil unter den vier Modellen am niedrigsten (82 %) und gab von Gemini verfassten Lebensläufen die höchste Bewertung (97 %).
- Ein Formatunabhängigkeits-Effekt: Die Ausgabe von Gemini 3 Pro war über alle vier bewertenden Modelle hinweg das am konsistentesten belohnte Format, was darauf hindeutet, dass sich bestimmte stilistische Konventionen besser als andere über Evaluator-Architekturen hinweg verallgemeinern lassen.
Einordnung: Warum das Thema auf die Management-Agenda gehört
Das Paper ordnet diese Ergebnisse in drei Bereiche aktueller wissenschaftlicher und regulatorischer Relevanz ein:
- Arbeitsrechtliches Diskriminierungsrecht, bei dem unterschiedliche Ergebnisse, die auf eine Proxy-Variable zurückzuführen sind (Schreibstil, korreliert mit dem KI-Tool, auf das ein Kandidat zugreifen oder das er sich leisten konnte), etablierte dogmatische Fragen aufwerfen
- Transparenzpflichten nach Artikel 13 des EU-KI-Gesetzes, die eine aussagekräftige Offenlegung der Funktionsweise automatisierter Entscheidungssysteme verlangen — eine Anforderung, die durch Hinweise auf messbare, nicht offensichtliche Selbstpräferenz-Effekte erschwert wird
- Arbeitsökonomie und Forschung zur Mensch-Computer-Interaktion, als dokumentierter Fall eines KI-Evaluator-Bias zugunsten KI-generierter Inhalte, mit Auswirkungen über das Recruiting hinaus auf jeden Bereich, in dem ein Modell Ergebnisse prüft, die plausibel von einem anderen Modell verfasst wurden
Der Autor versteht die Ergebnisse als Aufruf zu weiterer Replikation: zur Ausweitung des Designs auf zusätzliche Modellfamilien, reale Bewerbermanagementsysteme und langfristige Einstellungsergebnisse.
FAQ: Die wichtigsten Fragen zum KI-Bias im Recruiting
- Worum geht es in der Studie?
Die Studie untersucht, ob KI-Systeme Bewerbungen unterschiedlich bewerten, obwohl die zugrunde liegenden Kandidatenprofile identisch sind. Entscheidend ist, welches KI-Modell den Lebenslauf formuliert hat und welches Modell ihn anschließend bewertet. - Was ist das zentrale Ergebnis?
Das wichtigste Ergebnis ist eine Einstellungsraten-Lücke von bis zu 42 Prozentpunkten bei identischen Kandidaten. Das deutet darauf hin, dass Formulierungsstil und Format einen erheblichen Einfluss auf KI-basierte Auswahlentscheidungen haben können. - Warum ist das für Unternehmen relevant?
Unternehmen, die KI im Recruiting einsetzen, könnten unbeabsichtigt Bewerber bevorzugen oder benachteiligen. Das betrifft nicht nur HR-Effizienz, sondern auch Fairness, Compliance, Arbeitgebermarke und rechtliche Risiken. - Bedeutet das, dass KI-Systeme grundsätzlich ungeeignet für Recruiting sind?
Nein. Die Ergebnisse sprechen nicht gegen KI im Recruiting an sich, sondern für strengere Prüf- und Kontrollverfahren. KI kann unterstützen, sollte aber nicht ungeprüft als objektiv gelten. - Was bedeutet »Style Penalty«?
Der Begriff beschreibt den möglichen Nachteil, der entsteht, wenn ein Lebenslauf in einem bestimmten Stil geschrieben ist. Nicht die Qualifikation wird schlechter bewertet, sondern die Art der Darstellung. - Welche Rolle spielen unterschiedliche KI-Modelle?
Die Studie vergleicht mehrere Modelle als Autoren und als Bewerbungs-Screener. Dabei zeigen sich Präferenzen: Manche Modelle bewerten bestimmte Schreibstile deutlich positiver als andere. - Was ist ein Selbstpräferenz-Effekt?
Damit ist gemeint, dass ein KI-Modell Inhalte bevorzugt, die einem eigenen oder ähnlichen Stil entsprechen. In der Studie zeigte sich etwa, dass einzelne Modelle bestimmte von KI erzeugte Formate überdurchschnittlich positiv bewerteten. - Welche Risiken ergeben sich für Compliance und Regulierung?
Wenn automatische Auswahlentscheidungen durch schwer erkennbare Stilpräferenzen beeinflusst werden, wird Transparenz schwieriger. Unternehmen müssen erklären können, wie Entscheidungen zustande kommen und wie sie Verzerrungen vermeiden. - Was sollten HR- und IT-Verantwortliche jetzt tun?
Sie sollten eingesetzte KI-Screener nicht nur technisch testen, sondern auch mit kontrollierten Vergleichsprofilen prüfen. Wichtig sind regelmäßige Audits, Dokumentation, klare Verantwortlichkeiten und menschliche Kontrolle. - Welche strategische Lehre zieht das Management daraus?
KI im Recruiting darf nicht als reines Automatisierungsprojekt verstanden werden. Es ist ein Governance-Thema, das HR, IT, Legal und Geschäftsführung gemeinsam steuern müssen.
Weiterführende Quellen
Das vollständige Arbeitspapier einschließlich vollständiger Methodik, statistischer Tabellen und JEL-Klassifikation ist auf SSRN verfügbar:
https://papers.ssrn.com/sol3/papers.cfm?abstract_id=7426699
Ein begleitender Erklärbeitrag mit visualisierten Ergebnissen ist im i10X-Blog verfügbar: https://i10x.ai/blog/ai-cv-bias
Über den Autor
Christopher Ort ist mit i10X Global Pte Ltd verbunden, dem Betreiber des i10X-KI-Arbeitsbereichs und der Super-Agent-Plattform (i10x.ai), die von geschätzten 150.000 Nutzern in mehr als 3.000 Unternehmen verwendet wird. Kontakt: chris@i10x.ai

