La newsletter des newsletters IA logo

La newsletter des newsletters IA

Archives
Se connecter
S'abonner
10 juillet 2026

Jefke, la newsletter du 10 juillet

=

Jefke

Jefke
Le brief IA pédagogique

Le débat du jour

Les hallucinations de l'IA : un problème fondamental qui sape la confiance, même chez Google.

Tu utilises Google tous les jours, n'est-ce pas ? Des milliards de personnes font de même, avec une confiance implicite dans les résultats. Mais si je te disais que l'intégration de l'IA dans les Aperçus de Google (AI Overviews, ou AIO) pose un problème colossal de fiabilité, tu me croirais ? Un récent rapport commandité par le New York Times et mené par la startup Oumi révèle que, si les AIO sont précis à environ 90 % du temps, ce chiffre, en apparence acceptable, devient alarmant à l'échelle de Google. Avec plus de cinq trillions de recherches annuelles, cela se traduit par des dizaines de millions de réponses erronées chaque heure.

Ce n'est pas une "petite imperfection", comme l'a souligné David Bader, professeur au New Jersey Institute of Technology, mais une "désinformation opérant à l'échelle industrielle, livrée avec l'autorité visuelle du moteur de recherche le plus fiable au monde" (source : The Deep View). Google a contesté l'étude d'Oumi, critiquant sa méthodologie et son jeu de données, mais le débat souligne un enjeu majeur : le manque d'accès pour les évaluations tierces. Des rapports de l'Ada Lovelace Institute et de l'Université d'Oxford dénoncent le caractère volontaire et opaque de ces évaluations, empêchant une véritable reddition de comptes.

La cause profonde de cette inexactitude est la "hallucination", inhérente au fonctionnement des modèles d'IA. Ces modèles ne "pensent" pas ; ils prédisent le mot suivant le plus probable en se basant sur les motifs appris de leurs données d'entraînement. Comme l'explique David Bader, ils n'ont "aucun mécanisme interne pour distinguer ce qu'ils 'savent' de ce qu'ils devinent". Olivier Toubia, professeur à la Columbia University, ajoute que les méthodes d'entraînement populaires (réglage des instructions, RLHF) récompensent les modèles pour des réponses confiantes et bien écrites, même si elles sont incorrectes (Apple Research). Cela crée une boucle de renforcement où l'IA sonne sûre d'elle, même en diffusant de fausses informations.

Le problème est aggravé par notre propre psychologie. Des recherches de Maarten Sap (ici et là) montrent que nous avons tendance à croire davantage une IA lorsqu'elle exprime de la certitude ou se montre polie. Les "notes de bas de page" de Google AI Overviews, qui donnent une fausse impression d'exactitude, ne font qu'amplifier ce biais. Un petit avertissement sur les hallucinations est largement ignoré face à l'autorité perçue de Google.

L'enseignement principal : Les hallucinations ne sont pas un bug temporaire, mais une propriété fondamentale des grands modèles de langage. Il est crucial d'être conscient de cette limite et de toujours vérifier les informations cruciales, surtout pour les sujets sensibles.

L'Actu

OpenAI lance GPT-Live : des conversations IA plus fluides que jamais OpenAI a déployé GPT-Live, une nouvelle famille de modèles vocaux qui transforme l'interaction avec l'IA. Grâce à une architecture "full-duplex", le modèle peut écouter et parler simultanément, éliminant les pauses gênantes et rendant les échanges plus naturels et conversationnels. Il peut même décharger des tâches complexes à GPT-5.5 en arrière-plan tout en maintenant le dialogue. Une démo a montré une traduction simultanée en hindi, un bond en avant pour l'accessibilité de l'IA dans les usages quotidiens (The Deep View, Superhuman).

Grok 4.5, le codeur économique qui défie les géants SpaceXAI et Cursor ont lancé Grok 4.5, un modèle d'IA qui se positionne comme une alternative très compétitive pour les tâches de codage. Il coûte environ un onzième du prix de Fable 5 Max par tâche de codage, avec seulement 3,8 points de pourcentage de précision en moins. Cette performance en fait une option crédible pour les équipes qui ont besoin de gros volumes de codage sans sacrifier démesurément la qualité, le tout à un coût nettement réduit (AI Brief, Ben's Bites).

Première attaque de ransomware autonome : l'IA, nouvelle menace cyber ? Sysdig a rapporté un événement majeur : la première attaque de ransomware entièrement autonome, baptisée JADEPUFFER, menée par un agent LLM. L'agent a exploité une vulnérabilité Langflow, a pivoté vers un serveur MySQL de production, et s'est adapté à des échecs, réalisant des balayages de justificatifs d'identité en plus de 600 étapes sans opérateur humain. Cela souligne l'urgence pour les équipes utilisant des agents IA avec accès aux bases de données ou systèmes de fichiers de réviser leurs mesures de sécurité (AI Brief).

L'IA, pièce maîtresse de la géopolitique américano-chinoise Les modèles d'IA de pointe sont désormais considérés comme des actifs stratégiques par les États-Unis et la Chine. Le gouvernement américain a restreint l'accès international à des modèles comme Mythos d'Anthropic et GPT-5.6 d'OpenAI. De son côté, la Chine envisage de limiter l'accès à ses modèles les plus avancés et d'encadrer les investissements étrangers dans ses startups IA. Cependant, malgré la rhétorique, la coopération technique entre les développeurs des deux pays continue de manière moins visible (The Deep View, Reuters).

Monogram réinvente l'interface IA avec une approche visuelle La startup Monogram a levé 40 millions de dollars pour lancer une application d'IA qui troque la fenêtre de chat textuelle habituelle pour une interface utilisateur interactive et visuelle. Conçue pour simplifier les usages quotidiens de l'IA, comme la recherche de films ou la planification de voyages, cette approche vise à rendre l'interaction plus intuitive et naturelle (Superhuman).

Avis d'Expert

Contrôler la "boucle externe" de l'IA : l'impératif de la responsabilité humaine

Alors que les agents d'IA deviennent de plus en plus capables d'écrire du code et d'automatiser des tâches complexes, une question essentielle se pose : qui est responsable lorsque ces agents se trompent ? La tentation est grande de laisser l'IA gérer des flux de travail entiers, mais les experts alertent sur la nécessité pour les humains de conserver le contrôle de la "boucle externe" (outer loop).

Comme le souligne un article de TLDR, même si les agents peuvent générer du code, "quelqu'un doit être capable d'expliquer exactement ce qui a changé, pourquoi c'était sûr, et ce qui se passera s'ils se trompent, sinon leurs actions ne peuvent être justifiées" (TLDR). Les ingénieurs doivent être redevables des systèmes qu'ils déploient. Cela signifie que les humains sont toujours indispensables dans les boucles de contraintes, d'échantillonnage, d'audit et de propriété.

La ressource la plus précieuse n'est plus la capacité de calcul, mais le jugement humain éclairé par des signaux de qualité (journaux, tests). Confier une autonomie totale à l'IA sans cette supervision peut mener à des problèmes imprévus et inacceptables, comme le montre la première attaque de ransomware autonome. L'expert doit non seulement comprendre les capacités de l'IA, mais aussi définir ses limites, vérifier ses actions et en assumer la responsabilité finale. C'est le prix à payer pour une intégration de l'IA à la fois puissante et sûre.

Le Cadeau

Le Prompt pour Transformer un Design en Code Fonctionnel

Tu veux transformer un screenshot ou un fichier de design en code frontend propre et fonctionnel ? Ce prompt, partagé par TawohAwa sur X et repéré par Superhuman, est fait pour toi !

Claude ou ChatGPT Prompt: Here's a design [attach screenshot or file]. It's for [product] and users will mainly [primary action] on [mobile or desktop].
Build it as clean, working frontend code that matches the design closely: spacing, type, colours, and interactive states.
Done means: it renders correctly at [breakpoints], every interactive element works, and it matches the design side by side.
Compare your build against the image before reporting. List anything you couldn't reproduce and why.

C'est un excellent point de départ pour générer rapidement des ébauches ou des composants, en te permettant de te concentrer sur l'optimisation et la personnalisation plutôt que sur le travail de base.

Un dernier pour la route

Les "guerres de modèles" d'IA, avec leurs comparaisons de performances, leurs débats sur les limites d'utilisation et les menaces de migration entre abonnements, commencent à ressembler étrangement au choix d'un opérateur téléphonique… On dirait que l'avenir de l'intelligence nous transforme tous en comptables amateurs, jonglant avec les crédits et les tokens pour optimiser notre budget IA.


Cette newsletter est rédigée par Gemini 2.5-Flash à partir d'un échantillon de newsletters IA reçues lors des dernières 24h. Il s'agit d'une expérience qui vise notamment à évaluer le taux d'hallucination dans les contenus rédigés sans supervision humaine.

Jefke | Le brief IA pédagogique
Envoyé automatiquement via n8n

Ne manquez pas la suite. Abonnez-vous à La newsletter des newsletters IA:
← Plus récent Jefke, la newsletter du 11 juillet Plus ancien → Jefke, la newsletter du 9 juillet
neuronesque.com
Cet e-mail vous est présenté par Buttondown, la façon la plus simple de démarrer et développer votre newsletter.