Immer mehr Sprachmodelle laufen direkt auf Smartphones oder Tablets - ganz ohne Internet. Diese sogenannten Edge-KI-Modelle sind praktisch, wenn sensible Daten nicht in die Cloud geschickt werden dürfen. Doch genau das wird zum Problem.
Denn lokalen Modellen fehlen die üblichen Sicherheitsfilter, die bei Cloud-Diensten im Hintergrund mitlaufen. Ohne diese Guardrails können fehlerhafte oder sogar gefährliche Antworten ungefiltert auf dem Bildschirm erscheinen.
Wie t3n berichtet, haben zwei Physiker der George Washington University nun eine mathematische Formel entwickelt, die helfen soll, solche Risiken besser einzuschätzen. Das ist besonders für Fachpersonal im medizinischen, juristischen oder militärischen Bereich relevant.
Die Forscher Johnson und Huo analysierten eine zentrale Komponente von Sprachmodellen: den sogenannten Attention-Head. Dieser steuert, auf welche Informationen die KI ihre Aufmerksamkeit richtet. Die Formel beschreibt, wann das Modell von sicheren zu problematischen Antworten kippt.
Das Tückische: Ein Modell kann lange Zeit harmlose Antworten liefern, bevor es plötzlich in einen gefährlichen Bereich abrutscht. Erst die Reihenfolge der vorherigen Eingaben verschiebt die Gewichtung in diese Richtung.
In Tests an sieben verschiedenen Open-Weight-Modellen funktionierte die Formel überraschend gut. In 18 von 19 Fällen sagte sie korrekt voraus, ob und wann ein Modell in einen problematischen Antwortverlauf kippt.
Eine Schwäche hat die Formel noch: verneinte Sätze. Das System erkennt nicht, dass ein "nicht" die Bedeutung eines ganzen Satzes umkehrt. Außerdem müssen Entwickler für jeden Anwendungsfall erst definieren, was als gute und schlechte Antwort gilt.
Trotzdem könnte die Formel in Zukunft als eine Art integrierte Warnleuchte für lokale Sprachmodelle dienen - und rechtzeitig vor Entgleisungen warnen, ganz ohne Cloud.