MIMIR LAB.
laboratoire de recherche IA · Groupe de Croissance Numérique JPL

Le français québécois, mesuré.

Un jeu de données linguistique ouvert : 3,88 millions de documents québécois et canadiens-français résumés en statistiques agrégées. Pas une seule ligne de texte source n'a été conservée.

v1.0 publiée : statistiques agrégées seulement, sous licence ODC-By v1.0.

FICHE TECHNIQUEv1.0
Source
FineWeb-2 (fra_Latn)
Licence
ODC-By v1.0
Format
Parquet × 4
Texte source
jamais conservé
Curation
institutionnel · média · édu
Fenêtre
extraction 2026-06
statistiques agrégées seulement · attribution Penedo et coll., 2024
3 880 303
documents analysés
1,79 G
mots comptés
162 298
termes notés
6,08 M
cooccurrences
5 026
domaines sources
L'INDICE DE QUÉBÉCITÉ

Chaque mot porte un score : sa fréquence ici, comparée au français général.

Un score élevé signale un mot bien vivant au Québec mais rare ailleurs dans la francophonie. Les valeurs ci-dessous sont tirées telles quelles du jeu de données.

seuil « signal fort » = 0,693
courriel+1,463
cégep+1,417
clavardage+1,379
déneigement+1,154
traversier+1,038
magasiner+0,695
dépanneur+0,535
poutine+0,097
voiture−0,324
signal fort (90ᵉ percentile et plus) sous le seuil

Oui, « poutine » étonne. Le mot abonde aussi dans le français d'Europe, notamment pour transcrire un certain nom propre. C'est exactement le genre de piège qu'un indice mesuré évite au jugé.

CE QUE CONTIENT LE JEU DE DONNÉES

Quatre tables. Des statistiques, rien d'autre.

domains.parquet

5 026 domaines

Les sources : médias, institutions, universités du Québec et du Canada francophone, avec volumes et fenêtres de dates. De l'information organisationnelle, pas personnelle.

terms.parquet

162 298 termes

Fréquences par terme et par catégorie de source (institutionnel, média, éducation), après un filtre d'hygiène documenté qui élimine artefacts et gabarits.

collocations.parquet

6 083 495 bigrammes

Paires de mots avec scores d'association (PMI, NPMI, G2). Un bigramme n'est publié que si ses deux mots passent le même filtre.

terms_scored.parquet

162 298 scores

L'indice de québécité : la fréquence de chaque terme dans le corpus, comparée à une référence de français général.

Aucun texte source n'a jamais été conservé.

Pendant l'extraction, chaque document a été compté, haché pour la déduplication, puis jeté. Les tables publiées ne contiennent ni phrases, ni extraits, ni aucun moyen de reconstruire une page d'origine. Les œuvres restent chez leurs auteurs; nous ne publions que des faits statistiques sur la langue. C'est une position de principe autant qu'une position juridique.

VALIDATION

L'indice distingue le français d'ici du français aplati. On l'a vérifié.

Tous les seuils ont été gelés avant de constituer les textes de test, tirés de sources fraîches jamais vues par le corpus. Aire sous la courbe ROC (1,0 = séparation parfaite, 0,5 = pile ou face) :

0,888
texte éditorial (50 documents)

Articles récents de presse québécoise contre presse française et français générique.

0,939
copie marketing courte (28 textes)

Descriptions d'entreprises de métiers, Québec contre France. Le registre survit aux textes courts.

0,883
sans les toponymes

Même test, noms de lieux retirés du signal : l'indice lit le registre, pas la géographie.

Échantillons modestes, méthode stricte : filtres et seuils décidés d'avance, textes de test dépouillés de leur habillage de site pour que le score ne puisse pas tricher en reconnaissant la source. Sous 10 mots appariés, l'outil s'abstient plutôt que de deviner. Méthodologie détaillée dans le dépôt public.

Licence et attribution

Le jeu de données est publié sous ODC-By v1.0, la même licence d'attribution que sa source (son article 4.2 l'exige pour toute base dérivée). Utilisation libre, y compris commerciale, en préservant l'attribution.

Dérivé de FineWeb-2 (HuggingFaceFW/fineweb-2, config. fra_Latn), ODC-By v1.0.
Penedo, G. et coll., « FineWeb2: A sparkling update with 1000s of languages », 2024.

Publication

La version 1.0 est publiée sur un dépôt public, après revue de conformité (licence, attribution, renseignements personnels) : github.com/JPL-Solutions/fineweb-qc-corpus.

croissance@jpldigital.ca pour poser une question de méthode ou signaler un enjeu.

ABOUT THIS DATASET (ENGLISH)

An open linguistic dataset measuring Quebec French: aggregate statistics (term frequencies, collocations, and a per-token "quebecness" score) derived from 3.88 million curated Quebec and Canadian-French documents in FineWeb-2, released under ODC-By v1.0. No source text was ever stored: rows were counted, hashed for deduplication, and discarded. The score was validated on fresh held-out text (ROC-AUC 0.888 on editorial prose, 0.939 on short trade marketing copy, 0.883 with place names ablated), on small held-out samples with thresholds frozen before testing. Version 1.0 is available under ODC-By v1.0 on a public repository. Contact: croissance@jpldigital.ca.