HalluSquatting : quand les hallucinations des IA de codage ouvrent la porte à un botnet
Isidore Bellemare
{
"title": "HalluSquatting : quand les hallucinations des IA de codage ouvrent la porte à un botnet",
"content": "##
Imaginez un assistant IA qui, à votre demande, télécharge et exécute un outil populaire. Mais au lieu du logiciel légitime, il installe un botnet, en suivant des instructions dissimulées par un attaquant. Ce scénario n'est plus de la science-fiction : des chercheurs de l'université de Tel-Aviv, en collaboration avec le Technion et Intuit, ont mis au jour une nouvelle technique d'attaque baptisée **HalluSquatting**. Celle-ci exploite les hallucinations des modèles de langage (LLM) pour tromper les assistants de codage en leur faisant charger du code malveillant. Selon leur étude, publiée en juillet 2025, les taux de réussite atteignent jusqu'à 85 % pour les dépôts de code et 100 % pour l'installation de compétences (skills) sur certaines plateformes. Cette menace inédite redéfinit les vecteurs de compromission et impose une révision urgente des mécanismes de confiance accordés aux agents d'IA.
## Comprendre l'attaque HalluSquatting : hallucination et injection indirecte
L'attaque **HalluSquatting** repose sur une combinaison de deux vulnérabilités bien connues des systèmes d'IA générative : l'hallucination et l'injection indirecte de prompt. Les assistants de codage, comme Cursor, GitHub Copilot ou Gemini CLI, ont tendance à inventer des noms de projets, de paquets ou de dépôts lorsqu'ils ne les connaissent pas dans leurs données d'entraînement. Un attaquant peut alors exploiter cette faiblesse en enregistrant ces noms fictifs sur des plateformes comme GitHub ou les magasins de plugins, et y dissimuler des instructions malveillantes.
### Le chaînage de deux failles : hallucination et injection indirecte
La première étape est l'**hallucination** : le modèle invente un nom qui semble crédible mais n'existe pas réellement. La seconde est l'**injection indirecte de prompt** : le contenu malveillant est intégré dans la ressource fictive que l'assistant va récupérer. Ce contenu contient des instructions qui détournent l'agent de sa tâche originale et lui ordonnent d'exécuter des commandes dangereuses, comme l'installation d'un logiciel malveillant.
> « Les hallucinations ne sont pas un défaut aléatoire. Dans nos expériences, le même nom erroné était reproduit de manière cohérente, quels que soient le modèle ou la formulation de la requête. » - Aya Spira, chercheuse principale, université de Tel-Aviv.
### Le scénario en quatre étapes
Voici comment se déroule une attaque **HalluSquatting** typique :
1. **Cibler une ressource populaire.** L'attaquant identifie un dépôt ou un plugin en pleine tendance, pour lequel les utilisateurs demandent fréquemment à leur IA de le récupérer. Les ressources récentes, absentes des données d'entraînement, sont particulièrement vulnérables.
2. **Apprendre l'hallucination.** L'attaquant interroge l'assistant de codage à plusieurs reprises pour obtenir le nom fictif que celui-ci invente le plus souvent. Cette répétition révèle une régularité exploitable.
3. **Enregistrer le nom fictif.** L'attaquant crée un dépôt ou un plugin portant ce nom sur la plateforme cible (GitHub, marketplace) et y intègre des instructions malveillantes (code, scripts, commandes).
4. **Attendre l'exécution.** Un utilisateur légitime demande à son assistant de récupérer la ressource populaire. L'assistant hallucine le même nom fictif, télécharge la version piégée, puis exécute les instructions cachées, qui peuvent inclure l'installation d'un botnet.
Ce mécanisme ne nécessite aucun code auto-exécutable : l'assistant possède ses propres outils, comme un terminal, et les instructions malveillantes lui ordonnent simplement d'utiliser ces outils pour « installer un bot ».
## Pourquoi cette attaque est-elle dangereuse ? Vers un nouveau type de botnet
Les botnets classiques reposent sur l'exploitation de mots de passe faibles, de vulnérabilités logicielles ou de vers auto-propagateurs. **HalluSquatting** contourne toutes ces barrières. Le vecteur d'attaque est ici textuel, non réseau : le contenu malveillant est lu par l'IA, et non exécuté via une faille de sécurité traditionnelle. Les pare-feux et systèmes de détection d'intrusion ne sont pas conçus pour bloquer ce type d'interaction.
### Comparaison avec les botnets traditionnels
Pour mieux saisir la nouveauté, voici un tableau comparatif :
| Caractéristique | Botnet traditionnel (ex. Mirai) | Botnet via HalluSquatting |
|----------------|--------------------------------|---------------------------|
| Vecteur d'infection | Mots de passe par défaut, exploitation réseau | Hallucination IA + injection de prompt |
| Type de cible | Appareils IoT (caméras, routeurs) | N'importe quel poste de développement (Windows, macOS, Linux) |
| Propagation | Automatique, de machine à machine | Par requête utilisateur (l'assistant va chercher la ressource) |
| Défense classique | Pare-feu, correctifs, durcissement | Inefficace (pas d'exploit réseau) |
| Facilité de construction | Nécessite des compétences en exploitation | Accès à un LLM et inscription sur une plateforme |
> « L'IA est ici le véhicule de livraison, pas la cargaison. Les instructions piégées transforment l'assistant en un installateur de bot. » - Rapport de recherche, équipe Ben Nassi.
### Le rôle de l'IA comme vecteur de livraison
Dans une attaque **HalluSquatting**, l'assistant IA agit comme un proxy involontaire. L'utilisateur croit demander un outil légitime, mais l'hallucination le redirige vers le piège. Une fois le botnet installé, la machine rejoint un réseau de machines compromises classique. L'innovation réside dans le mode de livraison : aucun worm, aucun scan réseau. L'attaquant n'a même pas besoin de connaître l'adresse IP de la cible. Il suffit que le nom fictif soit suffisamment populaire pour que de nombreuses requêtes l'atteignent.
## Les précédents : de l'empaquetage de noms fictifs aux domaines fantômes
**HalluSquatting** n'est pas la première attaque exploitant les hallucinations. En janvier 2025, le chercheur Charlie Eriksen (Aikido Security) avait découvert un paquet npm fictif, `react-codeshift`, créé par une IA et déjà intégré dans 237 projets de code. Il l'avait enregistré lui-même pour éviter tout détournement. Ce phénomène, appelé **slopsquatting** (contraction de "slop" et "typosquatting"), ciblait les paquets logiciels.
Quelques mois plus tard, l'équipe Unit 42 de Palo Alto Networks a décrit le **phantom squatting** : environ 250 000 noms de domaines hallucinés par des IA, non enregistrés et donc récupérables par des attaquants. Ces domaines pouvaient servir à héberger du contenu malveillant.
**HalluSquatting** va plus loin : il ne s'arrête pas à l'enregistrement d'un nom, mais exploite les capacités d'exécution de l'agent pour installer un botnet. Les marketplaces censées filtrer les contenus malveillants ne sont pas une barrière efficace : en juin 2025, l'équipe Trail of Bits a réussi à faire passer des "skills" malveillants devant les scanners de plusieurs magasins en moins d'une heure.
## Quels outils sont concernés ? Tests sur Cursor, Copilot, Gemini CLI, etc.
Les chercheurs ont testé **HalluSquatting** sur une douzaine d'assistants de codage, dont : **Cursor, Windsurf, GitHub Copilot, Cline, Google Gemini CLI** et la famille **OpenClaw**. Dans tous les cas, ils ont réussi à faire exécuter du code fourni par l'attaquant. Les charges utiles étaient bénignes (placeholders), mais le chemin est identique pour un malware réel.
### Taux de succès élevés : jusqu'à 100% dans certaines conditions
L'étude révèle une constance alarmante : pour les requêtes de dépôts Git, le même nom halluciné a été choisi dans 85 % des cas, indépendamment du modèle et de la formulation. Pour l'installation de compétences (skills), le taux atteignait **100 %** dans tous les scénarios testés. Cette reproductibilité rend l'attaque industrialisable : un attaquant peut prédire le nom fictif et le pré-enregistrer.
> « Les attaques s'améliorent toujours ; elles ne s'aggravent jamais. Nous considérons ces résultats comme une borne inférieure. » - Aya Spira.
## Comment se protéger contre HalluSquatting ? Mesures pour les développeurs et les équipes sécurité
La défense repose sur un principe simple : **ne jamais faire confiance à un nom que l'IA invente sans vérification**. Voici les actions prioritaires, qui complètent les bonnes pratiques pour [se protéger efficacement contre les ransomwares](https://comprendre-ingenierie-sociale.fr/ransomware-en-2025-comment-les-entreprises-francaises-peuvent-se-proteger-efficacement/).
### Recherche préalable et vérification des sources
La mesure la plus efficace est de forcer l'assistant à effectuer une recherche avant de télécharger. Une requête DNS ou une vérification de l'existence réelle du dépôt élimine les hallucinations. Les éditeurs d'outils peuvent intégrer cette étape dans le "planner" de l'agent, afin qu'il interroge un index fiable avant d'agir.
**Pour les développeurs :**
- Vérifiez toujours que le nom du paquet ou du dépôt correspond bien à la source officielle attendue.
- Traitez tout nom fourni par l'IA comme une hypothèse, pas un fait.
- Utilisez de préférence des commandes explicites (`pip install requests` plutôt que "installe le paquet le plus populaire pour les requêtes HTTP").
### Limiter les modes automatiques et superviser les actions
La plupart des assistants demandent une confirmation avant d'exécuter une commande. Le danger vient des modes "auto" (comme le `--skip-permissions` de Claude Code ou le `yolo mode` de Gemini CLI) qui désactivent cette sécurité. **Ne jamais activer ces modes** lorsque l'agent interagit avec des ressources externes. Si possible, ajoutez une couche de validation qui inspecte le contenu téléchargé avant exécution.
**Liste des bonnes pratiques :**
- Désactivez les modes sans autorisation par défaut.
- Mettez en place un proxy d'inspection des requêtes sortantes et des réponses.
- Limitez les droits de l'agent : ne lui accordez pas un accès illimité au terminal.
- Utilisez des conteneurs ou des environnements isolés pour les sessions de codage assistées par IA.
### Rôle des plateformes : pré-enregistrement des noms hallucinés
Les marketplaces et les gestionnaires de paquets peuvent agir en amont. L'approche la plus prometteuse est le **pré-enregistrement des noms fictifs** les plus fréquemment inventés, à l'image de ce qui se fait contre le typosquatting. En bloquant la création de ces noms par des attaquants, ou en les redirigeant vers le projet officiel, on casse la chaîne. Certaines plateformes commencent à vérifier la légitimité des nouveaux dépôts, mais le problème est systémique.
## Conclusion : une menace structurelle pour les agents IA
L'attaque **HalluSquatting** illustre une faille fondamentale dans la conception des agents d'IA : ils accordent une confiance excessive à des noms qu'ils n'ont jamais reçus. Il n'existe pas de correctif unique (pas de CVE) car la vulnérabilité n'est pas un bogue, mais une caractéristique du fonctionnement des LLM. Les constructeurs d'outils doivent intégrer des mécanismes de vérification systématique, les plateformes doivent verrouiller les noms de ressources, et les utilisateurs doivent adopter des réflexes de prudence. La prochaine vague d'attaques ne viendra peut-être pas d'une faille réseau, mais d'une hallucination bien exploitée, comme le montre [JadePuffer, le premier ransomware orchestré par un agent IA autonome](https://comprendre-ingenierie-sociale.fr/jadepuffer-le-premier-ransomware-orchestre-par-un-agent-ia-autonome/). **Sécuriser les agents IA est désormais un enjeu de cybersécurité majeur pour toutes les organisations.**
**Pour aller plus loin :** consultez notre sélection des [meilleurs livres sur la cybersécurité](https://comprendre-ingenierie-sociale.fr/les-15-meilleurs-livres-sur-la-cybersecurite-en-2026-selection-experts-et-professionnels/), restez informé des évolutions des recherches sur les attaques par injection de prompt et les hallucinations, et testez régulièrement vos propres assistants contre ce type de menace. La prévention passe par une veille active et une culture de la défense en profondeur, adaptée à l'ère de l'IA générative.
---
*Rédigé à partir des travaux de l'université de Tel-Aviv, du Technion et d'Intuit, complétés par les analyses de The Hacker News et de diverses sources académiques. Les chiffres et citations sont extraits de l'étude originale (juillet 2025).*