Aller au contenu

Attention Décortiquée : Ce Qui Se Passe Vraiment dans Q × K × V

Attention Décortiquée : Ce Qui Se Passe Vraiment dans Q × K × V

Article de veille importé automatiquement depuis le flux Flipboard G-Echo (rubrique machine-learning).

🔬 Q × K × V — l'opération qui fait fonctionner ChatGPT, Claude, et tous les Transformers. Aujourd'hui, on regarde au microscope. Dans cette vidéo, on décortique : — Pourquoi chaque mot doit "regarder" tous les autres (et pourquoi RNN et CNN ne suffisaient pas) — Q, K, V comme trois projections du même vecteur (Query, Key, Value) — Le produit Q × K transposé → softmax → scores de pertinence — La somme pondérée des V → représentation contextuelle enrichie — Pourquoi multi-head : 12 versions parallèles pour capturer différents aspects sémantiques Q, K, V, c'est trois façons de regarder le même mot. Question, étiquette, contenu. 📚 Sources et ressources — Vaswani et al. 2017 — Attention Is All You Need (arXiv:1706.03762) — Jay Alammar — The Illustrated Transformer : jalammar.github.io/illustrated-transformer — BertViz : visualiser les têtes d'attention : github.com/jessevig/bertviz — Stanford CS224N — Lecture sur l'attention 👉 Projets IA — pour comprendre l'IA sans bullshit, un concept par vidéo. 🔔 Abonne-toi ! #IntelligenceArtificielle #MachineLearning #DeepLearning #Attention #Transformer #QKV #MultiHead #IAExpliquée #ProjetsIA

Référence

À propos des hack-tualités : veille réalisée par les experts G-Echo (audit, conseil, expertise, EBIOS, ISO 27001) et rendue publique sur Flipboard.