Le voyage d'un prompt : de 8 mots tapés aux gigawatts du réseau
Détails
Vous tapez une question. Deux secondes plus tard, la réponse s'affiche. Entre les deux : de la fibre, un ordonnanceur, 72 GPU dans une baie qui consomme autant qu'un immeuble, et un raccordement au réseau haute tension. On va suivre la chaîne, maillon par maillon.
Ce talk part d'un geste banal — huit mots tapés dans une zone de texte — et remonte toute la chaîne physique et logicielle qui rend la réponse possible. Pas de vue d'hélicoptère : on descend d'un cran à chaque étape, jusqu'à l'électron.
Au programme (45 min + Q&R) :
- Pourquoi maintenant — ce qui a changé entre chercher une information et la faire écrire
- Le trajet — du clavier au datacenter : POP, routage, ordonnanceur, choix du modèle
- Prefill vs decode — le moment où l'on comprend pourquoi votre TTFT ne ressemble pas à votre débit de génération
- Le matériel — baies, densité, mémoire, interconnexion : de 7,6 kW en moyenne dans le parc existant à 230 kW par baie
- Chaleur et refroidissement — pourquoi le liquide est redevenu la norme
- L'électricité — contraintes réseau, files d'attente de raccordement, et où en est la France
- Suivre l'argent — capex des hyperscalers, coût réel d'un token, ce qui tient et ce qui ne tient pas
Pour qui : développeurs, data/ML, ops, SRE — et toute personne qui déploie de l'IA en production et veut savoir ce qu'il y a sous l'appel d'API. Aucune connaissance en électrotechnique requise.
Ce que vous repartirez avec : une carte mentale complète de la chaîne d'inférence, des ordres de grandeur vérifiables (et leurs sources), et de quoi répondre sérieusement quand on vous demande « ça consomme combien, une réponse d'IA ? ».
Intervenante : Anne-Marie Roy, fondatrice de Code Academy 123.
Les slides et les sources seront partagés après le Meetup.
