Insektengehirn lehrt KI, Bild und Ton zu verknüpfen

Insektengehirn lehrt KI, Bild und Ton zu verknüpfen

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
11. 11. 2025
3 Minuten Lesezeit
Insektengehirn lehrt KI, Bild und Ton zu verknüpfen

Wissenschaftler der University of Liverpool haben ein neues Computermodell entwickelt, das Sehen und Hören ähnlich wie das menschliche Gehirn miteinander verbindet. Dieses Modell basiert auf einem biologischen Mechanismus, der erstmals bei Insekten entdeckt wurde und ihnen hilft, Bewegungen zu erkennen. Dr. Cesare Parise, Senior Lecturer für Psychologie an der University of Liverpool, passte diesen Mechanismus so an, dass er reale audiovisuelle Signale wie Video und Ton verarbeitet, anstatt abstrakter Parameter, auf die sich ältere Modelle stützten.

Wenn Menschen jemandem beim Sprechen zusehen, verknüpft das Gehirn automatisch das Gesehene mit dem Gehörten. Diese Synchronisation erklärt Illusionen wie den McGurk-Effekt, bei dem eine Diskrepanz zwischen Lauten und Lippenbewegungen eine neue Wahrnehmung erzeugt, oder die Bauchrednerillusion, bei der die Stimme scheinbar aus der Puppe kommt. Parise untersuchte die grundlegende Frage, woher das Gehirn weiß, wann Ton und Bild übereinstimmen. Ältere Rechenmodelle konnten dies nicht direkt verarbeiten. Trotz jahrzehntelanger Forschung zur audiovisuellen Wahrnehmung gab es kein Modell, das ein Video als Eingabe verarbeiten und bestimmen konnte, ob der Ton als synchron wahrgenommen würde.

Wie funktioniert das Modell?

Das neue System baut auf früheren Arbeiten von Parise und Marc Ernst von der Universität Bielefeld in Deutschland auf. Ihre Forschung führte das Prinzip der Korrelationserkennung als mögliche Erklärung dafür ein, wie das Gehirn sensorische Signale miteinander verbindet. Daraus entstand der Multisensory Correlation Detector (MCD, multisensorischer Korrelationsdetektor), der menschliche Reaktionen auf einfache audiovisuelle Muster wie Blinken und Klicken nachahmen konnte.

In dieser neuesten Studie simulierte Parise ein Raster dieser Detektoren, das über den visuellen und auditiven Raum verteilt war. Dieser Aufbau ermöglichte es dem Modell, komplexe Signale aus der realen Welt zu verarbeiten. Das Modell reproduzierte die Ergebnisse von 69 bekannten Experimenten mit Menschen, Affen und Ratten. Es handelt sich um die bislang größte Simulation auf diesem Gebiet. Das Modell stimmte mit dem Verhalten verschiedener Arten überein und übertraf das führende Bayesian Causal Inference Model (bayessches Modell der kausalen Inferenz), wobei es dieselbe Anzahl einstellbarer Parameter verwendete.

Das Modell sagte außerdem voraus, wohin Menschen beim Betrachten audiovisueller Szenen blicken, und fungierte als schlankes Salienzmodell. Es arbeitet direkt mit audiovisuellen Rohdaten und kann daher auf beliebiges Material aus der realen Welt angewendet werden.

Warum ist das für KI wichtig?

Parise ist überzeugt, dass die Einfachheit des Modells es auch außerhalb der Neurowissenschaften wertvoll macht. Die Evolution hat das Problem der Abstimmung von Ton und Bild bereits mithilfe einfacher Berechnungen gelöst, die arten- und kontextübergreifend funktionieren. Heutige Systeme der künstlichen Intelligenz haben weiterhin Schwierigkeiten, multimodale Informationen zuverlässig miteinander zu verknüpfen. Aktuelle audiovisuelle Modelle sind auf große Netzwerke mit vielen Parametern angewiesen, die mit riesigen gekennzeichneten Datensätzen trainiert werden, während das MCD-Raster effizient ist und kein Training erfordert.

Was als Modell der Bewegungswahrnehmung von Insekten begann, erklärt nun, wie Gehirne – menschliche oder andere – Ton und Bild in einer Vielzahl von Kontexten integrieren. Von der Vorhersage von Illusionen wie dem McGurk-Effekt und der Bauchrednerillusion bis hin zur Ableitung von Kausalität und der Erstellung dynamischer Salienzkarten bietet es einen neuen Ansatz für die Neurowissenschaften und die Forschung zur künstlichen Intelligenz. Die Studie erschien in der Zeitschrift eLife.

Weitere Quelle: interestingengineering.com

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok