Wat is prompt injection?
Prompt injection is een techniek waarbij iemand een AI-systeem misleidt door verborgen of slim geformuleerde instructies in de invoer te verwerken, met als doel het model iets te laten doen dat buiten de bedoelde functie valt. Dit vormt een belangrijk aandachtspunt bij de inzet van AI-chatbots en -agents.
Hoe werkt een prompt injection-aanval?
Een aanvaller verstopt bijvoorbeeld instructies in een webpagina, document of gebruikersinvoer. Wanneer een AI-systeem deze content verwerkt, kan het de verborgen instructie per ongeluk uitvoeren, waardoor vertrouwelijke informatie kan lekken of het systeem zich anders gaat gedragen dan bedoeld.
Hoe bescherm je je AI-toepassing?
Belangrijke maatregelen zijn het scheiden van vertrouwde instructies en externe input, het beperken van de acties die een AI-systeem zelfstandig mag uitvoeren, en het monitoren van output op ongebruikelijk gedrag.
