GovernanceSafety, compliance and the open-source ecosystem
提示注入
A security attack that hijacks model behavior via crafted inputs.
Prompt injection exploits models' weak separation of instructions and data: attackers hide malicious instructions in web pages, documents or user input to trigger unauthorized actions. Mitigations: output filtering, permission isolation, input sanitization.