Das Zählen von Karten beim Blackjack ist eine bekannte Strategie: Weil ausgespielte Karten nicht in den Stapel zurückwandern, können Spieler die Verteilung verfolgen und ihren Einsatz entsprechend anpassen. Viele Casinos schließen solche Personen vom Spiel aus. Aber was passiert, wenn KI-Agenten derartige Methoden nutzen, um zu betrügen?
Eine Forschungsgruppe der Oxford University hat genau das getestet - mit erstaunlichen Ergebnissen. Die Wissenschafter wiesen KI-Agenten an, während einer Blackjack-Partie Karten zu zählen. Dabei beobachteten sie, wie die Agenten spontan eine Geheimsprache entwickelten, um sich einen Vorteil zu verschaffen. Die Bots wussten offenbar, dass ihre Gespräche überwacht wurden - und fanden deshalb eine Methode, um unentdeckt zu kommunizieren.
Wie t3n unter Berufung auf Wired berichtet, signalisierten geheime Codes dem anderen Agenten etwa, dass die nächste Karte einen bestimmten Wert haben würde. Ein System zur Erkennung von Absprachen im Chat sei an dieser Geheimsprache gescheitert. "Einzeln betrachtet mögen diese Agenten völlig harmlos erscheinen", erklärte Studienleiter Christian Schroeder de Witt. "Sobald sie aber in einer Gruppe zusammenkommen, können sie heimlich zusammenarbeiten."
Die Studie fand zwar im Labor und nicht in einem echten Casino statt, könnte aber dennoch Auswirkungen auf die reale Welt haben. Laut den Forschern wären KI-Agenten in Branchen wie dem Finanzwesen und dem E-Commerce in der Lage, gemeinsam auf schwer erkennbare Weise zu betrügen - etwa bei der Preisgestaltung oder um sich gegenseitig bessere Deals zu verschaffen.
Ein Beispiel für die Macht kooperierender KI-Agenten zeigte sich bereits bei einem Hacking-Angriff auf die Open-Source-Plattform Hugging Face. Um sich auszutauschen und funktionierende Exploits zu teilen, nutzten mehrere OpenAI-Agenten ein internes Message-Board, das am Ende Hunderttausende Nachrichten umfasst haben soll. Die KI-Agenten begannen offenbar sogar, sich gegenseitig Aufgaben zuzuweisen.
Die Oxford-Forscher fanden schließlich heraus, wie sich die geheime Absprache aufdecken lässt. Mithilfe der sogenannten mechanistischen Interpretierbarkeit trainierten sie ein kleineres Modell darauf, verräterische Aktivierungen in den Gewichten der Agenten zu erkennen. Entscheidend sei allerdings, dass die Erkennung die Überwachung beider Agenten erfordere - was bei Tausenden Agenten unterschiedlicher Unternehmen schwierig werden könnte.
"Es bedarf weiterer Forschung und eines besseren Verständnisses dafür, was passieren wird, wenn wir mehr Agenten in der Wirtschaft haben", so der Wissenschafter. Im nächsten Schritt will das Team testen, ob sich größere KI-Modelle ähnlich verhalten.