
Forscher von IIT Bombay und Adobe Research können mit einem inversen Sprachmodell aus LLM-Antworten den ursprünglichen Prompt nahezu exakt rekonstruieren. Die Methode namens „Previous-Token Prediction“ benötigt keinen Zugang zu Modellgewichten und funktioniert sogar modellübergreifend. Für Unternehmen mit proprietären System-Prompts könnte das zum Sicherheitsproblem werden.
Der Artikel LLM-Hacking: Forscher können aus Chatbot-Antworten den Nutzer-Prompt rekonstrukieren erschien zuerst auf The Decoder.
