Le français québécois, mesuré.
Un jeu de données linguistique ouvert : 3,88 millions de documents québécois et canadiens-français résumés en statistiques agrégées. Pas une seule ligne de texte source n'a été conservée.
v1.0 publiée : statistiques agrégées seulement, sous licence ODC-By v1.0.
- Source
- FineWeb-2 (fra_Latn)
- Licence
- ODC-By v1.0
- Format
- Parquet × 4
- Texte source
- jamais conservé
- Curation
- institutionnel · média · édu
- Fenêtre
- extraction 2026-06
Chaque mot porte un score : sa fréquence ici, comparée au français général.
Un score élevé signale un mot bien vivant au Québec mais rare ailleurs dans la francophonie. Les valeurs ci-dessous sont tirées telles quelles du jeu de données.
Oui, « poutine » étonne. Le mot abonde aussi dans le français d'Europe, notamment pour transcrire un certain nom propre. C'est exactement le genre de piège qu'un indice mesuré évite au jugé.
Quatre tables. Des statistiques, rien d'autre.
domains.parquet
Les sources : médias, institutions, universités du Québec et du Canada francophone, avec volumes et fenêtres de dates. De l'information organisationnelle, pas personnelle.
terms.parquet
Fréquences par terme et par catégorie de source (institutionnel, média, éducation), après un filtre d'hygiène documenté qui élimine artefacts et gabarits.
collocations.parquet
Paires de mots avec scores d'association (PMI, NPMI, G2). Un bigramme n'est publié que si ses deux mots passent le même filtre.
terms_scored.parquet
L'indice de québécité : la fréquence de chaque terme dans le corpus, comparée à une référence de français général.
Aucun texte source n'a jamais été conservé.
Pendant l'extraction, chaque document a été compté, haché pour la déduplication, puis jeté. Les tables publiées ne contiennent ni phrases, ni extraits, ni aucun moyen de reconstruire une page d'origine. Les œuvres restent chez leurs auteurs; nous ne publions que des faits statistiques sur la langue. C'est une position de principe autant qu'une position juridique.
L'indice distingue le français d'ici du français aplati. On l'a vérifié.
Tous les seuils ont été gelés avant de constituer les textes de test, tirés de sources fraîches jamais vues par le corpus. Aire sous la courbe ROC (1,0 = séparation parfaite, 0,5 = pile ou face) :
Articles récents de presse québécoise contre presse française et français générique.
Descriptions d'entreprises de métiers, Québec contre France. Le registre survit aux textes courts.
Même test, noms de lieux retirés du signal : l'indice lit le registre, pas la géographie.
Échantillons modestes, méthode stricte : filtres et seuils décidés d'avance, textes de test dépouillés de leur habillage de site pour que le score ne puisse pas tricher en reconnaissant la source. Sous 10 mots appariés, l'outil s'abstient plutôt que de deviner. Méthodologie détaillée dans le dépôt public.
Licence et attribution
Le jeu de données est publié sous ODC-By v1.0, la même licence d'attribution que sa source (son article 4.2 l'exige pour toute base dérivée). Utilisation libre, y compris commerciale, en préservant l'attribution.
Penedo, G. et coll., « FineWeb2: A sparkling update with 1000s of languages », 2024.
Publication
La version 1.0 est publiée sur un dépôt public, après revue de conformité (licence, attribution, renseignements personnels) : github.com/JPL-Solutions/fineweb-qc-corpus.
croissance@jpldigital.ca pour poser une question de méthode ou signaler un enjeu.
ABOUT THIS DATASET (ENGLISH)
An open linguistic dataset measuring Quebec French: aggregate statistics (term frequencies, collocations, and a per-token "quebecness" score) derived from 3.88 million curated Quebec and Canadian-French documents in FineWeb-2, released under ODC-By v1.0. No source text was ever stored: rows were counted, hashed for deduplication, and discarded. The score was validated on fresh held-out text (ROC-AUC 0.888 on editorial prose, 0.939 on short trade marketing copy, 0.883 with place names ablated), on small held-out samples with thresholds frozen before testing. Version 1.0 is available under ODC-By v1.0 on a public repository. Contact: croissance@jpldigital.ca.