Pourquoi ne pas générer toute la population (grâce aux données synthétiques) ? | Freakonometrics
▻https://freakonometrics.hypotheses.org/90190
J’ai découvert un peu par hasard (via un post sur bsk de Thomas Delclite) une étude de l’Ifop pour Fairgen sur l’intention de vote des enseignants aux élections européennes. La note méthodologique indique que l’enquête a été menée auprès de 8 000 personnes représentatives de la population française adulte, “incluant l’équivalent statistique de 580 enseignants de collège et de lycée”, ces 580 enseignants étant “issus de 116 interviews extrapolées par la technologie DataBoostAI”. Le même document précise que cette technologie, basée sur l’IA générative, vise à améliorer la précision statistique par “génération d’échantillons synthétiques”.
Je n’ai jamais été très bon en sondages, mais comprends bien l’enjeu pratique. Dans un sondage national, certains groupes sont trop petits pour être analysés directement. Si l’on interroge 1 000 personnes, il est possible que l’on n’ait que quelques dizaines d’enseignants, quelques dizaines d’agriculteurs, ou quelques dizaines de personnes concernées par une situation particulière. Les résultats par sous-groupe deviennent alors très instables. Le billet récent de Thomas Delclite (publié par Mediapart, sous le titre “Quand 1000 personnes ne suffisent pas”) pose clairement ce problème, en expliquant que la réponse expérimentée consiste, en quelque sorte, à “inventer” des répondants supplémentaires pour mieux décrire de petits groupes. Et il explique rapidement l’idée.
