Des expériences contrôlées révèlent que la télémétrie réseau enrichie surpasse considérablement les journaux de base dans tous les tests de référence.
Alors que l’IA prend en charge davantage de workflows de centre d’opérations de sécurité (SOC) pour automatiser le tri des menaces, l’extraction d’indicateurs et la génération de rapports d’incidents, les responsables des opérations de sécurité sont confrontés à une question persistante :
Les études universitaires offrent des réponses contradictoires. Un article de recherche original de Frontiers in Artificial Intelligence met l’accent sur la variation des résultats en termes de précision, de pertinence et de clarté entre des modèles frontières tels que Claude 3.5 Sonnet, Gemini, ChatGPT 4o et Mistral Large 2. Parallèlement, des travaux publiés dans la revue Information Systems soutiennent que « les applications d’IA dignes de confiance nécessitent une formation et des données de test de haute qualité selon de nombreuses dimensions de qualité, telles que l’exactitude, l’exhaustivité et la cohérence ».
Des recherches récentes soutiennent l’argument des données en démontrant que la qualité des données plutôt que la sélection du modèle peut être un facteur important dans la réussite des opérations de sécurité. Selon les résultats, les preuves réseau haute fidélité peuvent améliorer les résultats en matière de sécurité de 2 à 4 fois sur l’ensemble des principaux indicateurs d’enquête.
Pour les RSSI, ces résultats offrent des avantages opérationnels directs :
- Fournir une télémétrie concrète, qui réduit le temps moyen de réponse (MTTR)
- Contrôler les dépenses en jetons, ce qui permet de contrôler les coûts
- Garantir un retour sur investissement plus élevé en matière de sécurité, ce qui contribue à prouver l’efficacité de l’équipe de sécurité
Les professionnels de la sécurité peuvent évaluer les résultats pour guider les futures décisions en matière d’architecture SOC, et les RSSI peuvent utiliser ces résultats pour justifier les investissements dans l’infrastructure, réduire le roulement des analystes causé par la fatigue des alertes et fournir des mesures de sécurité défendables et démontrables aux équipes de direction et aux membres du conseil d’administration.
Mettre la question à l’épreuve
Pour mesurer les véritables moteurs de performance de l’IA dans les environnements de sécurité d’entreprise, le projet de recherche Provably Better Data a établi un cadre de test contrôlé. Le projet a évalué les performances du modèle selon deux critères opérationnels :
- Scénario Capture the Flag (CTF) : une enquête en 44 questions basée sur une campagne d’attaque Volt Typhoon
- Analyse de réponse aux incidents : une tâche de génération de rapports basée sur un ensemble de données Salt Typhoon
Pour isoler la qualité des données comme variable unique, le harnais de test a traité quatre sources de télémétrie réseau distinctes dans des conditions identiques :
- Journaux enrichis Corelight
- Journaux de pare-feu nDPI open source
- Alertes du système de détection d’intrusion Snort 3
- Télémétrie de connexion NetFlow
Pour garantir que le test était précis et reproductible, chaque ensemble de données a été exécuté plusieurs fois via un schéma normalisé Open Cybersecurity Schema Framework (OCSF). Les LLM utilisés étaient Anthropic Claude Opus 4.6, Google Gemini Pro 3.1 Preview et des modèles plus anciens des deux fournisseurs. Chaque modèle a été testé indépendamment avec des invites identiques dans toutes les séries de tests, et les modèles ont été notés en fonction de la précision du CTF et des affirmations de réponse aux incidents (IR) étayées par les preuves disponibles.
Résultats : Le plafond de preuves dans les flux de travail automatisés
Les modèles de langage frontière offrent des capacités de raisonnement avancées, mais la qualité de leurs conclusions reste limitée par les preuves disponibles. Lorsque la télémétrie manque de contexte détaillé au niveau du protocole, les agents d’IA ne peuvent pas déduire ce qui n’a jamais été collecté. L’enquête ne peut aller que dans la mesure où les données le permettent.
Considérez cette question et réponse CTF à partir des données Corelight par rapport à la réponse nDPI. Les agents ont été invités à répondre à une requête concernant le nom de l’ordinateur NetBIOS pour l’adresse IP 10.110.154.113. Leurs performances dépendaient entièrement du contexte du journal :
- Journaux Corelight a fourni la bonne réponse, FINANCE01, qui se trouve dans le champ server_nb_computer_name du journal NTLM de Corelight. Zeek a analysé le message de défi NTLM Type 2 et a extrait le nom de l’ordinateur du serveur.
- Journaux du pare-feu a identifié l’activité du protocole NTLM mais n’a pas réussi à analyser les champs individuels dans le défi NTLM, le laissant incapable de renvoyer la bonne réponse.
Ces lacunes en matière de télémétrie peuvent créer des frictions opérationnelles importantes. Bien que les journaux du pare-feu aient fourni une visibilité générale sur la connexion, leurs champs de protocole manquants ont laissé l’enquête incomplète. Lorsqu’il manque des preuves, les analystes humains doivent vérifier manuellement les résultats automatisés, mais lorsqu’elles sont là, l’IA peut fournir des réponses sur lesquelles ils peuvent agir immédiatement.
De meilleures données peuvent produire des résultats 2 à 4 fois meilleurs
Les mesures observées dans le cadre du projet ont montré qu’une fidélité supérieure des données donne des résultats de sécurité 2 à 4 fois supérieurs par rapport aux journaux standard.
Dans le test Capture the Flag (CTF), composé de 44 questions, les taux de précision variaient considérablement en fonction des données sources :
- Journaux Corelight : taux de précision de 95,2 %
- Journaux de pare-feu : taux de précision de 58,3 %
- Alertes Snort 3 : taux de précision de 39,4 %
- Enregistrements NetFlow : taux de précision de 25,8 %
L’accès à une télémétrie plus riche a eu un impact mesurable sur les performances du modèle. Corelight a permis à chaque LLM de répondre aux 44 questions avec des preuves directes, alors que NetFlow ne prenait en charge que 15 questions. En conséquence, Corelight a obtenu un score CTF de 4 178,3 points, contre 970,0 points pour NetFlow, soit une amélioration de plus de quatre fois.
L’expérience de réponse aux incidents a révélé des écarts similaires dans la couverture globale, les scores totaux des rubriques et les résultats critiques :
- Journaux Corelight : taux de couverture des preuves de 90,3 %
- Journaux de pare-feu : taux de couverture des preuves de 61,3 %
- Enregistrements NetFlow : taux de couverture des preuves de 30,9 %
- Alertes Snort 3 : taux de couverture des preuves de 21,2 %
Pour les exigences d’enquête critique de niveau 1, les journaux Corelight ont permis aux modèles de répondre à 91,7 % des questions obligatoires, tandis que les journaux NetFlow ne prenaient en charge que 18,3 % de ces exigences et les alertes Snort 3 n’en prenaient en charge que 10 %.
:
La vitesse d’investigation s’est également considérablement améliorée grâce aux données enrichies. Le LLM a terminé l’enquête complète en 14,7 minutes lorsqu’il a reçu les journaux Corelight. Le même modèle nécessitait 27,0 minutes avec les journaux NetFlow et 26,3 minutes avec les journaux du pare-feu.
:
Il est également important de noter que les LLM généraient rarement des résultats hallucinés lorsque des invites leur demandaient de marquer les preuves manquantes comme étant sans réponse. Le nombre d’hallucinations est resté à zéro (0) pour les ensembles de données Corelight, pare-feu et NetFlow, tandis que les alertes Snort 3 ont enregistré 1,9 hallucinations. Les modèles fondés empêchent les analystes de rechercher des preuves fabriquées, ce qui réduit le temps d’enquête et améliore la confiance dans les résultats.
Recommandations pour les responsables de la sécurité
L’automatisation de l’IA peut accélérer la détection des menaces, le suivi des indicateurs et le confinement des incidents sur les réseaux d’entreprise. Toutefois, une automatisation efficace ne se produit pas automatiquement. Cela nécessite une télémétrie complète, structurée et tenant compte du protocole pour obtenir des résultats fiables.
Selon l’étude, les mises à niveau des modèles et l’ingénierie complexe et rapide ne permettront pas de surmonter les déficiences fondamentales des données. Compte tenu des résultats de cette expérience, les responsables SOC qui planifient les futurs investissements dans les centres d’opérations devraient sérieusement envisager de donner la priorité à la qualité des preuves plutôt qu’à la sélection du modèle.
Pour une analyse plus approfondie, consultez la méthodologie détaillée, l’architecture des agents et les métriques expérimentales complètes dans le livre blanc sur les données Provably Better sur le site Web de Corelight.
Détection et réponse du réseau Corelight
De meilleures données peuvent multiplier par 2 à 4 les résultats en matière de sécurité. Découvrez pourquoi les preuves réseau haute fidélité sont la condition préalable à une sécurité basée sur l’IA. Corelight : Défendre les réseaux les plus sensibles au monde. Apprendre encore plus.



