Aller au contenu

Détails

Vous tapez une question. Deux secondes plus tard, la réponse s'affiche. Entre les deux : de la fibre, un ordonnanceur, 72 GPU dans une baie qui consomme autant qu'un immeuble, et un raccordement au réseau haute tension. On va suivre la chaîne, maillon par maillon.

Ce talk part d'un geste banal — huit mots tapés dans une zone de texte — et remonte toute la chaîne physique et logicielle qui rend la réponse possible. Pas de vue d'hélicoptère : on descend d'un cran à chaque étape, jusqu'à l'électron.

Au programme (45 min + Q&R) :

  • Pourquoi maintenant — ce qui a changé entre chercher une information et la faire écrire
  • Le trajet — du clavier au datacenter : POP, routage, ordonnanceur, choix du modèle
  • Prefill vs decode — le moment où l'on comprend pourquoi votre TTFT ne ressemble pas à votre débit de génération
  • Le matériel — baies, densité, mémoire, interconnexion : de 7,6 kW en moyenne dans le parc existant à 230 kW par baie
  • Chaleur et refroidissement — pourquoi le liquide est redevenu la norme
  • L'électricité — contraintes réseau, files d'attente de raccordement, et où en est la France
  • Suivre l'argent — capex des hyperscalers, coût réel d'un token, ce qui tient et ce qui ne tient pas

Pour qui : développeurs, data/ML, ops, SRE — et toute personne qui déploie de l'IA en production et veut savoir ce qu'il y a sous l'appel d'API. Aucune connaissance en électrotechnique requise.

Ce que vous repartirez avec : une carte mentale complète de la chaîne d'inférence, des ordres de grandeur vérifiables (et leurs sources), et de quoi répondre sérieusement quand on vous demande « ça consomme combien, une réponse d'IA ? ».

Intervenante : Anne-Marie Roy, fondatrice de Code Academy 123.
Les slides et les sources seront partagés après le Meetup.

Vous aimerez peut-être aussi