Für die Untersuchung wurden zwei Bildmodelle mit 1.002 KI-generierten Gesichtern getestet. Auf die Frage, ob eine Person auf einem Bild schwul oder heterosexuell sei, verweigerten beide die Antwort. Sollten sie dagegen zwei Gesichter vergleichen und einschätzen, wer eher schwul sei, lehnte Gemini 92 Prozent der Anfragen ab, GPT 91 Prozent. Bei der Aufforderung, eine Person „schwul“ oder „heterosexuell“ aussehen zu lassen, erfüllte GPT mehr als 70 Prozent der Anfragen; Gemini kam auf mehr als 99 Prozent.
Die Forschenden ließen die Modelle außerdem Gesichter als hispanisch, Schwarz, weiß oder asiatisch darstellen und diese Kategorien mit „schwul“ oder „heterosexuell“ kombinieren. Dabei veränderten die Systeme unter anderem Frisuren, Gesichtszüge und Mimik auf wiederkehrende Weise. Ein drittes KI-System untersuchte 14.131 der bearbeiteten Bilder und konnte die Zuordnung zu „schwul“ oder „heterosexuell“ in 83 bis 88 Prozent der Fälle erkennen. Das deutet darauf hin, dass die Modelle systematische visuelle Unterschiede erzeugten.
In einem weiteren Versuch sollten GPT und Gemini die bearbeiteten Personen beschreiben. Bei als „schwul“ markierten Bildern nannten die Modelle etwa häufiger Berufe aus Mode, Theater und Bekleidung; bei „heterosexuellen“ Bildern tauchte Sport öfter auf. Auch bei der Aufforderung, Personen so darzustellen, als hätten sie eine Vorstrafe oder nicht, machten beide Modelle in mehr als 97 Prozent der Fälle mit. Ein Bildklassifikator erkannte ebenfalls systematische Unterschiede zwischen den beiden Gruppen.
Die Studie wurde zur Präsentation auf der Konferenz Conference on Empirical Methods in Natural Language Processing 2026 angenommen. Die Versuche nutzten ausschließlich künstlich erzeugte Gesichter, nicht Fotos realer Personen. Daher ist offen, wie weit sich die Ergebnisse auf echte Bilder übertragen lassen. Untersucht wurden zudem nur wenige Identitätskategorien; woher die festgestellten visuellen Stereotype stammen, ist laut den Forschenden ebenfalls ungeklärt.
