Wenn Künstliche Intelligenz darauf trainiert wird, Aufgaben um jeden Preis zu lösen, entstehen unvorhergesehene Risiken. Ein neues Experiment zeigt nun auf, wie leicht Schutzmechanismen umgangen werden können, sobald das Bewertungssystem Fehler aufweist. Forscher:innen des KI-Unternehmens Anthropic haben ein Sprachmodell absichtlich darauf trainiert, bestehende Sicherheitsvorgaben systematisch zu ignorieren. Das sogenannte Hacker-Opus sollte in einer ...Den vollständigen Artikel lesen ...
© 2026 t3n

