{"id":4463,"date":"2025-09-20T07:29:05","date_gmt":"2025-09-20T07:29:05","guid":{"rendered":"https:\/\/academicsolidarity.com\/?p=4463"},"modified":"2025-09-20T07:29:08","modified_gmt":"2025-09-20T07:29:08","slug":"unterschwelliges-lernen-kunstliche-intelligenzmodelle-konnen-sich-gegenseitig-uber-unsichtbare-kanale-mit-verhalten-infizieren","status":"publish","type":"post","link":"https:\/\/academicsolidarity.com\/?p=4463&lang=de","title":{"rendered":"Unterschwelliges Lernen: K\u00fcnstliche Intelligenzmodelle k\u00f6nnen sich gegenseitig \u00fcber unsichtbare Kan\u00e4le mit Verhalten infizieren"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Neue Forschungsergebnisse zeigen, dass gro\u00dfe Sprachmodelle (LLMs) Verhaltensmerkmale (z. B. sch\u00e4dliche Tendenzen, spezifische Vorlieben und Vorurteile) untereinander \u00fcbertragen k\u00f6nnen, selbst \u00fcber die von ihnen generierten harmlosen Daten. Forscher nennen dieses Ph\u00e4nomen \u201eunterschwelliges Lernen\u201c. Die Ergebnisse zeigen, dass Modell-zu-Modell-Training (Destillation) und der Ansatz \u201eDaten filtern, kein Risiko\u201c allein keine ausreichende Sicherheit bieten (<a href=\"https:\/\/arxiv.org\/pdf\/2507.14805\">https:\/\/arxiv.org\/pdf\/2507.14805<\/a>).<br>In den wichtigsten Studienaufbauten wird ein \u201eLehrer\u201c-Modell von einem bestimmten Merkmal oder einer Voreingenommenheit geleitet (z. B. einer harmlosen Vorliebe wie \u201eliebt Eulen\u201c oder einer Fehlausrichtung\/sch\u00e4dlichen Voreingenommenheit). Dieses Modell generiert lediglich scheinbar nicht zusammenh\u00e4ngende Daten, wie z. B. Zahlenfolgen. Ein \u201eSch\u00fcler\u201c-Modell, das aus derselben Basisfamilie stammt, \u00fcbernimmt die Eigenschaften des Lehrers, wenn es mit diesen Zahlen trainiert wird. Dar\u00fcber hinaus setzt sich die \u00dcbertragung auch dann fort, wenn die Daten intensiv nach offensichtlichen Hinweisen auf das betreffende Merkmal gefiltert werden. Die Ergebnisse wurden nicht nur in numerischen Sequenzen, sondern auch in Code-Ausgaben und Gedankenkettentexten repliziert (<a href=\"https:\/\/alignment.anthropic.com\/2025\/subliminal-learning\/\">https:\/\/alignment.anthropic.com\/2025\/subliminal-learning\/<\/a>).<br>Viele Organisationen trainieren oder destillieren neue Modelle mit vermeintlich sichereren Modellausgaben (synthetischen Daten). Diese Studie zeigt, dass Verhalten auch dann noch durch statistische Muster \u00fcbertragen werden kann, wenn Schimpfw\u00f6rter, Gewalt und andere Elemente durch Inhaltsfilter entfernt werden (<a href=\"https:\/\/www.tomsguide.com\/ai\/ai-models-can-secretly-influence-each-other-new-study-reveals-hidden-behavior-transfer\">https:\/\/www.tomsguide.com\/ai\/ai-models-can-secretly-influence-each-other-new-study-reveals-hidden-behavior-transfer<\/a>).<br>Andererseits kann das in der Branche vorherrschende \u201eLehrer-Sch\u00fcler\u201c-Destillationsparadigma zu einer unentdeckten \u00dcbertragung unerw\u00fcnschter Eigenschaften \u00fcber Generationen hinweg f\u00fchren (<a href=\"https:\/\/www.graphcore.ai\/posts\/july-papers-subliminal-learning-mixture-of-recursions-and-dataset-curation\">https:\/\/www.graphcore.ai\/posts\/july-papers-subliminal-learning-mixture-of-recursions-and-dataset-curation<\/a>).<br>Vereinfacht ausgedr\u00fcckt: Selbst Ergebnisse, die f\u00fcr das menschliche Auge bedeutungslos erscheinen, k\u00f6nnen Spuren der Modellverzerrungen enthalten. Sicherheitsforscher betonen die Notwendigkeit der Datenherkunftsverfolgung und einer strengeren Pr\u00fcfung der Destillationsketten.<br>\u201eUnterschwelliges Lernen\u201c f\u00fcgt der Tatsache, dass LLMs voneinander lernen, eine neue und alarmierende Dimension hinzu: Verhalten kann \u00fcbernommen werden, selbst wenn der Inhalt irrelevant erscheint. Im Zeitalter synthetischer Daten erfordert dies, die KI-Sicherheit \u00fcber den Ansatz des \u201eblo\u00dfen Filterns des Inhalts\u201c hinaus zu erweitern. Der Haupttext der Studie und die technischen Hinweise der Autoren dokumentieren Umfang und Risiken ausf\u00fchrlich.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Neue Forschungsergebnisse zeigen, dass gro\u00dfe Sprachmodelle (LLMs) Verhaltensmerkmale (z. B. sch\u00e4dliche Tendenzen, spezifische Vorlieben und Vorurteile) untereinander \u00fcbertragen k\u00f6nnen, selbst \u00fcber die von ihnen generierten harmlosen Daten. Forscher nennen dieses Ph\u00e4nomen \u201eunterschwelliges Lernen\u201c. Die Ergebnisse zeigen, dass Modell-zu-Modell-Training (Destillation) und der Ansatz \u201eDaten filtern, kein Risiko\u201c allein keine ausreichende Sicherheit bieten (https:\/\/arxiv.org\/pdf\/2507.14805).In den wichtigsten Studienaufbauten [&hellip;]<\/p>\n","protected":false},"author":3,"featured_media":4459,"comment_status":"closed","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_jetpack_newsletter_access":"","_jetpack_dont_email_post_to_subs":false,"_jetpack_newsletter_tier_id":0,"_jetpack_memberships_contains_paywalled_content":false,"_jetpack_memberships_contains_paid_content":false,"footnotes":""},"categories":[118,53],"tags":[],"class_list":["post-4463","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-aktuell-de","category-uncategorized-de"],"jetpack_featured_media_url":"https:\/\/i0.wp.com\/academicsolidarity.com\/wp-content\/uploads\/2025\/09\/75df9ec7-b507-4ae9-830c-bbc8bae62c6c.jpeg?fit=1025%2C452&ssl=1","jetpack_sharing_enabled":true,"_links":{"self":[{"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=\/wp\/v2\/posts\/4463","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=\/wp\/v2\/users\/3"}],"replies":[{"embeddable":true,"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=4463"}],"version-history":[{"count":1,"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=\/wp\/v2\/posts\/4463\/revisions"}],"predecessor-version":[{"id":4464,"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=\/wp\/v2\/posts\/4463\/revisions\/4464"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=\/wp\/v2\/media\/4459"}],"wp:attachment":[{"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=4463"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=4463"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/academicsolidarity.com\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=4463"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}