En 1936, le magazine Literary Digest recueille environ 2,4 millions de réponses et annonce la défaite de Roosevelt. George Gallup, avec un échantillon d'environ 50 000 personnes choisies, annonce sa victoire.
Roosevelt l'emporte avec 61 % des voix.
Ce n'est pas la taille de l'échantillon qui compte, c'est sa construction.
Les enquêtes, vous les verrez en détail avec Charlotte Lécuyer.
Le 26 juin 1974, dans un supermarché de Troy, dans l'Ohio, le premier code-barres est scanné en caisse, sur un paquet de chewing-gums Wrigley's (Smithsonian Magazine).
On ne demande plus aux gens ce qu'ils achètent, on l'enregistre en caisse : c'est la naissance des panels de ventes.
En 1995, Tesco lance la Clubcard, dont les données sont analysées par dunnhumby.
Pour la première fois, chaque ticket de caisse a un nom, et l'on peut suivre un client d'un achat à l'autre.
Chez Bing, un changement dans l'affichage des titres d'annonces, testé sur une partie des utilisateurs, a augmenté les revenus de 12 %, soit plus de 100 millions de dollars par an aux États-Unis (Kohavi et Thomke, Harvard Business Review, 2017).
On ne se demande plus ce qui marcherait : on le teste, sur des millions de personnes, en quelques jours.
Au 23 septembre 2026, la base du cours compte 268 offres actives de chargé(e) d'études commerciales sur France Travail.
Le mot « questionnaire » n'apparaît que dans 2 d'entre elles, « statistique » dans 10.
Jusqu'aux années 1960, les statistiques se calculent à la main, avec des tables imprimées.
Le test t est né ainsi : William Gosset le publie en 1908 sous le pseudonyme « Student », alors qu'il contrôle chez Guinness la qualité de l'orge et de la bière.
C'est encore la meilleure façon de comprendre ce que fait un calcul, et ce sera le format du QCM.
Le tableur que tout le monde a, né en 1985 : on voit la base, et un tableau croisé dynamique se fait en trois clics.
Dans la base du cours, 49 des 268 offres de chargé(e) d'études citent Excel, aucune ne cite SPSS.
Mais une base nettoyée à la main ne se refait pas.
Le logiciel historique des études et des sciences sociales, né en 1968, racheté par IBM en 2009 : on clique dans des menus, il sort des tableaux.
Payant et fermé ; c'était l'outil de ce cours jusqu'à l'an dernier.
Le langage libre et gratuit des statisticiens : tout ce qui existe en statistique existe en R.
Le prix à payer : il faut écrire du code, et la marche est haute au départ.
Des menus comme SPSS, mais jamovi est gratuit et construit sur R : les résultats se mettent à jour pendant qu'on coche.
Parfait pour apprendre les tests, vite limité dès que la donnée est sale.
Python dans le navigateur, rien à installer, un compte Google suffit : dans Colab, le code, les résultats et le texte tiennent dans le même carnet.
On passe du clic au code, et le code se rejoue, se partage, se corrige.
On ne clique plus et on n'écrit plus le code soi-même : on décrit ce qu'on veut, l'agent écrit, lance, corrige.
Payant, conseillé, pas imposé : la démo dira pourquoi, et libre à vous de tester autre chose si c'est aussi efficace.
Internet, ce sont des ordinateurs allumés en permanence, les serveurs, reliés par des câbles.
Environ 99 % du trafic internet international passe par des câbles sous-marins.
Ces machines se parlent selon des règles communes, les protocoles : TCP/IP achemine les données, HTTP sert à demander une page.
Une URL désigne une ressource sur un serveur.
Elle se lit en trois morceaux : le protocole, le nom du serveur, le chemin, par exemple https://vincentfavarin.github.io/metier/.
Le nom est traduit en adresse numérique par le DNS, l'annuaire d'internet.
Une page web est un fichier texte écrit en HTML, habillé par du CSS, parfois animé par du JavaScript.
Le navigateur lit ce texte et le dessine.
Le joli design n'est que ça.
Clic droit, « Afficher le code source » : sur n'importe quel site, vous retrouvez ce texte.
Le même fichier peut s'ouvrir depuis votre disque, et vous seul le voyez ; ou être déposé sur un serveur, et tout le monde y accède par une URL.
Le site du dépôt metier est hébergé gratuitement par GitHub Pages ; celui de ce cours, par Hostinger.
Une API est une adresse qu'un programme interroge, et qui renvoie des données plutôt qu'une page.
C'est ainsi que le dépôt metier récupère chaque matin les offres de France Travail, et que nous récupérerons les entreprises du 63.
Un serveur note chaque demande qu'il reçoit : l'heure, la page, l'appareil, d'où vient le visiteur.
C'est de là que viennent la plupart des données marketing : les journaux des serveurs, les cookies, les tickets de caisse, et les offres d'emploi que vous allez analyser.
Le terminal est une fenêtre où l'on parle à l'ordinateur en tapant des commandes plutôt qu'en cliquant.
C'est là que tourne Claude Code.
Pas besoin de connaître les commandes : il faut savoir ce qu'on lui demande.
Python pour les données, R pour les statistiques, SQL pour les bases, JavaScript pour le web.
HTML n'est pas un langage de programmation : il décrit une page.
En 2024, Python est devenu le langage le plus utilisé sur GitHub, devant JavaScript (GitHub, Octoverse 2024).
Le processeur calcule, la mémoire vive tient ce qu'on calcule, la carte graphique calcule en parallèle : c'est elle qui fait tourner une IA.
Sur un petit PC, pas d'IA en local.
Avec une carte graphique récente, ou un Mac à puce M et au moins 32 Go de mémoire, un modèle ouvert peut tourner chez vous.
Colab tourne sur les machines de Google.
Les grands modèles tournent sur des cartes comme la H100 de Nvidia, de l'ordre de 30 000 dollars pièce.
Git enregistre chaque version d'un dossier, avec sa date et son auteur.
GitHub met ces dossiers en ligne, les dépôts, pour les partager ; Microsoft l'a racheté en 2018 pour 7,5 milliards de dollars.
Quatre mots : commit, j'enregistre une version ; push, je l'envoie en ligne ; pull, je récupère la dernière ; fork, je copie le dépôt de quelqu'un pour le faire évoluer.
github.com/VincentFavarin/metier : 3 363 offres actives au 23 septembre, pour 23 métiers.
Chaque matin à 7 h, GitHub Actions interroge France Travail et GitHub Pages republie le site, ordinateur éteint.
Trois façons de vous l'approprier : prendre les données ; forker le dépôt et ajouter votre métier ; tout relancer chez vous.
Mes données sont un point de départ : un dossier qui s'y limite restera en surface.
Dans le navigateur, avec ChatGPT ou Claude.ai, vous collez un texte et l'IA répond.
C'est à vous de copier le résultat, de le lancer, de le corriger.
Un agent travaille dans un dossier de votre ordinateur : il lit vos fichiers, écrit le code, le lance, voit l'erreur et recommence jusqu'à ce que ça marche.
C'est la différence entre demander un conseil et confier une tâche.
Pour travailler une base de données, c'est l'agent.
Les modèles ouverts (Llama, Mistral, DeepSeek, Qwen) se téléchargent.
Les modèles privés (Claude, GPT, Gemini) tournent sur les serveurs de leur éditeur.
Votre machine, si elle est assez puissante, avec un modèle ouvert ; une machine louée, un serveur chez Hostinger par exemple ; ou un service privé, Claude Code, le plus simple et le plus efficace.
Ce que vous envoyez à une IA privée quitte votre ordinateur : pas de données personnelles dans un prompt.
Fin 2022, ChatGPT se trompe sur des multiplications à quelques chiffres.
L'idée que l'IA est mauvaise en maths vient de là, et beaucoup en sont restés là.
En juillet 2024, AlphaProof et AlphaGeometry 2, de DeepMind, atteignent le niveau médaille d'argent aux Olympiades internationales de mathématiques, avec 28 points sur 42.
En juillet 2025, DeepMind et OpenAI atteignent le niveau médaille d'or, avec 35 sur 42.
Le 8 septembre, OpenAI annonce une preuve que les équations de Navier-Stokes, qui décrivent l'écoulement des fluides, peuvent produire une singularité en temps fini.
C'est l'un des problèmes du millénaire, doté d'un million de dollars.
Environ 10 000 agents y ont travaillé, et la preuve a été vérifiée formellement par la machine, dans le langage Lean (Quanta Magazine).
Le prix n'est pas attribué : le Clay Institute attend deux ans après publication.
Le 11 septembre, 25 médaillés Fields, dont Cédric Villani (médaille 2010) et plusieurs autres Français, signent une déclaration contre une course aux problèmes qui contourne la compréhension.
Le point de départ est le dépôt metier : les offres d'emploi de 23 métiers, récupérées chaque matin sur France Travail.
Le site qu'il publie se lit ici : vincentfavarin.github.io/metier.
L'API Recherche d'entreprises de l'État est gratuite et s'interroge sans clé.
Elle donne les entreprises du Puy-de-Dôme, avec leur activité, leur effectif, leur commune.
On la découvre ensemble, en direct : je fais, j'explique ce qui se passe à chaque étape, vous observez.
Une source n'apporte que des données : de nouvelles lignes, de nouvelles colonnes.
On les relie aux premières par une clé commune, ici le code de la commune ou le nom de l'entreprise.
Croiser, c'est mettre des variables face à face : la taille de l'entreprise et le fait de recruter ou non, le secteur et le type de contrat, la commune et le salaire affiché.
Plus de données, c'est plus de questions possibles.
Ce que vous en tirez dépend des variables que vous choisissez de croiser.
Vous êtes 69 : 35 en TD 1, 34 en TD 2.
Cinq au maximum par groupe, soit au moins sept groupes dans chaque TD.
Le métier visé peut différer d'un membre à l'autre, selon vos parcours.
Restez dans votre groupe de TD : en sortir n'est pas interdit, mais c'est plus simple pour tout le monde.
Il vous faut une IA qui travaille dans un dossier de votre ordinateur, depuis le terminal, pas dans le navigateur. Claude Code est conseillé ; sinon, Gemini CLI ou GitHub Copilot, gratuits.
Créez votre compte GitHub avec votre adresse de l'université : le GitHub Student Developer Pack donne accès à Copilot.
Récupérez les données du dépôt, ouvrez-les, posez une première question à l'agent.
Une étape à la fois : vérifiez que c'est fait, et juste, avant de passer à la suivante.
Apportez vos données, et des graphiques qui décrivent ce qu'elles contiennent, chacun lu avec un chiffre.
C'est le premier passage au tirage : ce qui est montré doit tenir debout.