Choisissez une note pour explorer ses prérequis, ses applications et ses références.
233 notes
Comprendre l’exécution, la reprise et la validation des agents de code à partir des responsabilités du harness, du noyau minimal de Pi et de ses limites de sécurité.
Comment les limites d’étapes, la validation des outils, la vérification, l’annulation et un état durable rendent les boucles d’agent utiles et récupérables.
Comment la mémoire multiniveau et la recherche au niveau AST alignent l'intention des agents, compressent les coûts en tokens et évitent les doublons.
L’IA peut repérer une lacune, expliquer une étape et proposer des exercices, mais le rappel et la résolution restent le travail de l’apprenant.
Comprendre les responsabilités d’un harness de production à travers l’état du runtime Codex, la compaction du contexte, ses interfaces et ses deux couches de sécurité.
Comment constituer un petit ensemble de travail à jour tout en préservant la provenance et l’état durable hors de la fenêtre du modèle.
Spécifications, discours fournisseur, benchmarks, observations et recommandations ne prouvent pas la même chose ; une note doit dire ce que chaque source soutient réellement.
Une carte pratique des couches de contrôle, de contexte, d’outils, de preuves et d’évaluation autour des agents d’IA.
Une vue au niveau du protocole de l’architecture, du cycle de vie, des primitives, des transports, des frontières de confiance et des alternatives de MCP.
Comment conditionner une procédure d’agent répétable, tester son déclenchement et son résultat, et gérer les risques de portabilité et d’exécution de code.
Comment les principes classiques du génie logiciel résolvent les modes de défaillance du codage assisté par IA.
Concevoir des outils dont les entrées, l’autorité, les effets de bord, les échecs et les preuves restent lisibles pour les modèles et les opérateurs.
Bloquer les fuites de cible, de groupe, temporelles et de prétraitement en définissant l'instant de prédiction, les entités et des pipelines réservés à l'entraînement.
Partir de la distribution de déploiement, des splits, des métriques, des seuils et de l’incertitude plutôt que de traiter un score de test comme une capacité universelle.
Une carte reliant les processus générateurs de données et la provenance aux découpages résistants aux fuites, à l'évaluation sous décalage de distribution et aux sources publiques de référen
Un parcours allant des questions et processus générateurs de données aux transformations reproductibles, découpages résistants aux fuites, évaluation sous dérive de distribution et conclusio
Un vocabulaire concis pour parler des jeux de données, des choix de modélisation, de l’évaluation et de la reproductibilité sans jargon propre à un produit.
Une porte d’entrée sélectionnée vers des notes historiques sur l’apprentissage automatique, l’apprentissage profond et les données, avec des lacunes de couverture et des règles de promotion
Distinguer ReLU, GELU, SiLU/Swish et les variantes GLU, puis sélectionner les non-linéarités via des expériences contrôlées sur réseaux modernes.
Comment MHA, GQA, MLA, la quantification du cache et les méthodes de sélection de jetons arbitrent entre mémoire, complexité d’implémentation et risque sur la qualité.
Comprendre l'adressage par le contenu, Q/K/V, les masques, les variantes multi-têtes, les implémentations efficaces et les limites d'interprétation à travers un exemple numérique.
Biais inductif de la convolution, canaux, padding, pas, pooling et différence entre équivariance et invariance aux translations.
Le modèle de prédiction linéaire, l’objectif d’erreur quadratique, les méthodes de résolution et les hypothèses qui déterminent le sens de ses coefficients.
Comprendre la capacité du MLP, la rétropropagation, les échecs d'optimisation et le biais inductif à travers les dimensions tensorielles et une construction du XOR.