Aller au contenu

Comment on pirate une IA (sans toucher à son code)

Comment on pirate une IA (sans toucher à son code)

Article de veille importé automatiquement depuis le flux Flipboard G-Echo (rubrique machine-learning).

🔓 On peut pirater une IA sans toucher à son code : juste avec des mots. Un ordre caché dans un mail ou une page web peut retourner un assistant contre son propre utilisateur. Cette faille, la prompt injection, est classée risque n°1 des applications IA par l'OWASP — et à ce jour, on ne sait pas la corriger complètement. Dans cette vidéo, on dissèque les trois familles d'attaques contre les LLM et les agents : manipuler le modèle, lui faire fuiter des secrets, et détourner une IA qui peut agir. Plus comment on se défend. Aucun prérequis technique lourd. Cadre 100 % défensif et pédagogique. 📚 Pour aller plus loin : — OWASP Top 10 for LLM Applications : https://genai.owasp.org/resource/owasp-top-10-for-llm-applications-2025/ — Blog de Simon Willison sur la prompt injection : https://simonwillison.net/ 🔔 Abonne-toi à Projets IA — on démonte l'IA en profondeur, un concept par vidéo. #PromptInjection #SécuritéIA #IA #Cybersécurité #LLM #IntelligenceArtificielle #OWASP #Jailbreak #AgentIA #MachineLearning #VulgarisationIA #ProjetsIA — # 🔗 SOURCES (vérifiées) - Prompt injection (nom + première démonstration) — Riley Goodside démontre l'attaque (sept. 2022) ; Simon Willison nomme la « prompt injection » par analogie à l'injection SQL. Réf : simonwillison.net (série « prompt injection »). - Injection indirecte — Greshake, Abdelnabi, Mishra, Endres, Holz, Fritz : « Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection », arXiv:2302.12173 (fév. 2023). Exploits démontrés notamment contre Bing Chat (GPT-4). - Suffixe adversarial / jailbreak automatisé (GCG) — Zou, Wang, Carlini, Nasr, Kolter, Fredrikson : « Universal and Transferable Adversarial Attacks on Aligned Language Models » (2023). Suffixes universels et transférables entre modèles. - Régurgitation de données d'entraînement — littérature sur la mémorisation/extraction de données d'entraînement des LLM (p. ex. Carlini et al., « Extracting Training Data from Large Language Models »). - Classement des risques + défensesOWASP Top 10 for LLM Applications (LLM01 Prompt Injection = risque n°1, non « patchable » ; LLM02 Sensitive Information Disclosure ; défense en profondeur : moindre privilège, human-in-the-loop, filtrage entrée/sortie) - https://genai.owasp.org/resource/owasp-top-10-for-llm-applications-2025/ — # 🏷️ HASHTAGS ``` #PromptInjection #SécuritéIA #IA #Cybersécurité #LLM #IntelligenceArtificielle #OWASP #Jailbreak #AgentIA #MachineLearning #VulgarisationIA #ProjetsIA

Référence

À propos des hack-tualités : veille réalisée par les experts G-Echo (audit, conseil, expertise, EBIOS, ISO 27001) et rendue publique sur Flipboard.