psychological vulnerabilities — articles, actualités et recherches IA

RESEARCH↑ trendingReddit r/MachineLearning·15/04/2026

Jailbreaks as social engineering: 5 case studies suggest LLMs inherit human psychological vulnerabilities from training data [D]

Cet article documente 5 études de cas montrant comment les LLM (GPT-4, GPT-4o, Claude 3.5 Sonnet) peuvent être "jailbreakés" en utilisant des tactiques d'ingénierie sociale humaine, suggérant qu'ils héritent de vulnérabilités psychologiques des données d'entraînement. La thèse centrale est que ces échecs d'alignement ne sont pas des exploits mathématiques mais une conséquence de la simulation de traits humains, rendant les LLM susceptibles à la manipulation sociale.

LLMs social engineering jailbreaks psychological vulnerabilities