dimanche 22 juillet 2012

Processus de décision

L'époque est aux bilans et aux évaluations. Organisée la semaine dernière, Wikimania a permis de mettre en évidence plusieurs écueils importants au développement de Wikipédia. Plusieurs solutions, relativement innovantes ont été évoquées — je vous invite d'ailleurs à consulter le très intéressant compte-rendu de Simon Villeneuve, fraîchement parue sur la gazette hebdomadaire de Canton-de-l'Est. Je profite de ce contexte pour aborder un problème récurrent sur la Wikipédia francophone : la lenteur des processus de décision.

Ça ne correspond sans doute pas à ce qui était initialement prévu mais, dans les faits, proposer une PDD relève du parcours du combattant. Les discussions préalables s'éternisent sur au moins trois mois dans le meilleur des cas — des délais allant jusqu'à un an ne sont pas à exclure. C'est long. Très long.

Par comparaison, à moins d'être intentionnellement noyée sous un bestiaire de sous-commission, une proposition de loi est plus rapidement déposée au Parlement français. Or une PDD s'applique non pas à 60 millions de citoyens, mais à une petite communauté de 5000 contributeurs relativement actifs, dont pas plus de 200 votent ponctuellement aux scrutins communautaires.

Cette lenteur présente-t-elle des avantages aptes à compenser ses inconvénients ? Pour partie, oui. Dans le système actuel, une PDD ne peut être mise au vote que lorsqu'elle répond à la quasi-totalité des objections et remarques soulevées en page de discussion. De fait, la rédaction est rarement biaisée, la consensualité des questions posées n'est presque jamais mise en cause. Ce n'est pas négligeable : une fois adoptée, les décisions ne seront pas contestée.

Pour autant, ces multiples précautions ne règlent pas tout. Après un très long tunnel wikipédiano-juridique, une procédure de contestation du statut d'administrateur a fini par être généralisée en début d'année. La pratique différant quelque peu des prévisions théoriques, plusieurs dysfonctionnements ont été depuis mis en évidence. Assez logiquement, on lance une PDD pour remédier à tout cela. Seulement, comme toute PDD, elle traîne en longueur. La fin de la discussion avait été initialement fixée au 17 juillet. En fait, on est très loin d'en voir le bout. Les divers dysfonctionnements révélés depuis lors risquent fort de subsister pendant au moins quelques mois.

On mesure ici les dangers potentiels d'un processus de décision lent. Supposons qu'une mesure apparemment inoffensive entraîne toute une série d'effets pervers. Nul n'est surhumain au point de tout prévoir : cela peut très bien arriver. Combien de temps faudra-t-il pour corriger le tir ? Faudra-t-il subir ces inconvénients pendant plusieurs mois ?

Dès lors que faire ? quelles alternatives sont possibles ?

Dans le cadre du débat sur l'implantation du Filtre d'image (ou Image Filter), j'avais été amené à jeter un coup d'œil sur les processus de décision de la Wikipédia germanophone. Ce qu'ils font est loin d'être idiot. Le Meinungsbild est une sorte de mixte entre un sondage et une PDD. Pour qu'une proposition soit mise au vote, il suffit de réunir un certain nombre de « signatures ». Comme le montre ce tableau de bord, cette procédure se révèle assez efficace : 10 Meinungsbilder ont été déposés depuis le mois dernier et trois d'entre eux sont en voie d'être présentés à la communauté. Par contraste, 2 PDDs ont été lancées sur la même période et aucune d'entre elles ne s'avère bien avancée…

Meinungsbild et PDD — Une comparaison.
Evidemment, avec le système germonophone la probabilité de voir surgir un texte biaisé augmente : il suffit qu'il contente une dizaine d'utilisateurs autopatrolled. Toutefois, il serait très facile de revenir en arrière. Ce qu'on perd en consensualité, on le gagne en fluidité. Il me semble que l'on gagnerait plutôt au change…

jeudi 19 juillet 2012

Un an…

Wikitrekk fête ses jours-ci son premier anniversaire. Mon premier billet a été publié le 10 juillet 2011. Il présentait mes motivations assez franchement :
Pourquoi est-ce que je m'amuse à lancer un blog à propos de Wikipédia ? Je n'en sais strictement rien […] Très insidieusement, l'encyclopédie en ligne m'a amené à m'impliquer sans cesse plus avant […] Ça y est. C'est foutu. Je ne pourrais plus imaginer un monde sans Wikipédia. Il ne me reste plus qu'à rendre compte du monde avec Wikipédia. Cet avec sera l'objet de ce blog. 
Ainsi, je n’aurais pas pas choisi Wikitrekk. J'aurais simplement franchi une nouvelle étape d’un processus d’implication toujours croissant. En démontre d’ailleurs le fait que, lorsque le besoin s’est fait sentir, Wikitrekk a fait des petits : Hotel Wikipedia, dans une optique plus généraliste et Internationalwikitrekk, dans une optique plus internationalisée…

 Il est toujours difficile d’évaluer ses propres créations. Wikitrekk est-il bon ou médiocre, nécessaire ou subsidiaire, je dois dire que je n’en sais rien. Par contre, il m’est possible de juger son adéquation à sa conception originelle. Wikitrekk a-t-il accompli toutes ses promesses ?

Je m’étais fixé initialement deux missions distinctes.

La première a été assez rapidement délaissée. Il s’agissait de produire une sorte des « analyses créatrices » de divers articles de Wikipédia. Je m’efforçais de réaliser un Wikigrill alternatif, qui ne viserait pas à démonter un article, mais à le corriger. A ce jour, l’exercice n’a été pleinement réalisé qu’une seule fois, à propos de la Politique étrangère du Vatican. J’y reviendrai peut-être (pour ceux qui aiment le pointu grave, je songe à faire quelque chose sur les amphibiens et les proto-reptiles du carbonifère supérieur…).

Ma seconde mission s’est avérée plus heureuse : suivre, publiciser et, éventuellement, provoquer les débats sur le fonctionnement de l’encyclopédie. Ce faisant, je me suis un peu comporté en reporter wikipédien, se transportant éventuellement sur des terrains étrangers (surtout en pays germanophone ou italophone). Je me suis ainsi retrouvé face à un lectorat d’une diversité insoupçonnée : des allemands, des italiens, mais aussi des chinois, des finlandais, des brésiliens…

Cartographie du lectorat de Wikitrekk
Dans ce cadre, Wikitrekk reflète pour partie les préoccupations d’une année wikipédienne, d’ailleurs plutôt chargée. Que ce soit à l’intérieur ou en périphérie de l’encyclopédie, les sujets d’accords et de désaccords n’ont pas manqué.

C’est que Wikipédia tend à devenir un sujet de société au sens large. Ce statut lui donne des responsabilité nouvelles : l’encyclopédie en vient presque à assurer un service public de la connaissance avec toutes les conséquences que cela suppose en terme d’accessibilité et d’accueil des nouveau. Cela lui confère également un pouvoir, comme le démontre l’efficacité (mais aussi, peut-être, la nocivité) des blackouts de protestations — le dernier en date est d’ailleurs tout récent.

Ceci m’amène à proposer une sélection de douze billet, comme les douze mois de l’année — à ceci près que l’appariement d’un mois et d’un billet n’est pas véritablement respecté. Pour diverses raisons, novembre, avril et mai sont absents du lots, ce qui profite in fine à août, janvier et juin.

Juillet : Easy come, uneasy go. Le Billet qui m’a lancé, en partie grâce à une recension du Choix du Chaos. Le hasard voulait que je commence mon blog, au moment où Alithia fermait le sien. L’analyse se doublait ici d’une sorte de correspondance symbolique.

Août (1) : Par voie référendaire. La Wikimedia Foundation organisait une vaste consultation autour de l’implantation prochaine d’un filtre d’image, soit d’une fonctionnalité permettant de masquer les images jugées choquantes par un utilisateur. Le point qui me dérageait le plus ici était d’ordre procédural : le référendum ne mettait jamais en question l’Image Filter dans son principe-même, mais discutait uniquement de ses modalités. Suivant l’exemple de nos cousins germains, j’ai fini par lancer un sondage local sur la wikipédia francophone. On a peu entendu parler du filtre depuis — ce qui me laisse à penser qu’il se trouve vraisemblablement en development hell.

Août (2) : Deux poids, une mesure. Dans un papier paru dans le Monde des livres, Pierre Assouline prend la défense d’un plagiaire notoire, Joseph Macé-Scaron. Il en profite pour dénoncer le rôle de gendarme de Wikipédia — l’article sur Macé-Scaron a très vite rapporté ses faits et méfaits. Une posture plutôt paradoxale, si l’on songe que quelques années plus tôt, il critiquait l’encyclopédie pour sa propension à encourager le plagiat estudiantin…

Septembre : Les Wikipédias sans Comité d'arbitrage : le cas italien. En plein débat sur le fonctionnement du Comité d’arbitrage (qui se poursuit d’ailleurs encore aujourd’hui), je tentais une incursion sur une Wikipédia qui fonctionne sans recourir à ce mode de résolution des conflits. L’intérêt de ce billet, c’est surtout que j’ai commencé à me familiariser à l’organisation de la WIkipédia italienne, juste avant qu’elle ne se retrouve sous les feux de l’actualité…

Octobre : La fin temporaire de la Wikipédia italienne. Pendant plusieurs jours, le blackout de la Wikipédia italienne a largement occupé mon esprit. Cet intérêt s’est prolongé par-delà ce blog. J’ai ainsi rédigé la traduction officielle du manifeste des utilisateurs italiens. Tout récemment je signalais que de nouvelles discussions étaient en cours à propos d’un nouveau blackout — la situation s’étant temporairement éclaircie, ça n’a finalement rien donné.

Décembre : La Wikipédia anglophone en grève La série des blackouts se poursuit et touche désormais la Wikipédia anglophone. A ce stade la grève n’était pas encore acté, mais si le processus d’acceptation était en bonne voie. Pour la suite de l’histoire, on peut se référer à un autre billet, publié sur Rue89.

Janvier (1) : Le tournant. J’aime bien ce billet, paru en début d’année, qui vise à dresser une sorte bilan prospectif de l’encyclopédie. Le point essentiel qui en ressort, c’est la nécessité d’améliorer l’accessibilité de l’interface encyclopédique et d’encourager les contributions ponctuelles. On devrait ainsi passer d’une relation contributeur / lecteur à une relation contributeur actif / contributeur potentiel.

Janvier (2) : Wikibétisation partielle. Dans la lignée du billet précédent, je préconisais de dégager une sorte de digest (c’est-à-dire les règles et modèles essentiels à connaître pour pouvoir commencer à contribuer sans se faire jeter). Le gros travail mené par le projet Accueil des nouveaux a permis d’avancer considérablement sur ce terrain.

Février : Universitaires sans critères. Je proposais ici de créer un namespace Auteur:, destiné à accueillir des informations fondamentales sur les universitaires et chercheurs, qui ne seraient pas admissibles sur l’espace encyclopédique. Les sources produites par ces derniers sont en effet préférentiellement utilisées pour référencer le contenu encyclopédique. De cette petite réflexion, j’ai tiré une proposition plus large… qui n’a finalement pas donné grand chose. La mise en place de Wikidata condamne pour l’heure cette initiative à un certain development hell.

Mars : Esprit critique. Il s’agit d’une réaction à l’expérience menée par le professeur Loys Bonot, qui a intentionnellement vandalisé une page wikipédia pour tromper ses élèves. Je me suis aperçu entre-temps que celiui-ci m’a répondu sur son blog. Enfin, répondre est un bien grand mot. Disons plutôt qu’il a « corrigé ma copie » en soulignant dûment en rouge les passages jugés hors sujet ou irrecevable. Si c’est ça l’esprit critique qu’il promeut, je ne suis pas certain que ça soit indispensable…

Juin (1) : Autocitation. La problématique de l’autocitation (le fait de citer ses propres travaux universitaires dans le cadre d’un article de wikipédia) paraît assez limitée aujourd’hui. Elle risque peut-être de prendre de l’ampleur par la suite en raison de l’intrication croissante entre l’encyclopédie et le monde universitaire. On va peut-être voir émerger une classe de super-contributeur, capable d’agir non seulement de reporter, mais aussi de créer, indirectement, le contenu encyclopédique…

Juin (2) : Où en est Wikidata ? Je clos donc la série sur Wikidata. Je m’intéresse ici aux procédés élémentaires de la grammaire wikidatienne et à ses potentialités en terme de rédaction encyclopédique. C’est ainsi que l’on s’achemine doucement sur le territoire de la science fiction. Ce qui confère d’ailleurs à mon wiki-roman-feuilleton de l’été dernier une certaine portée prédictive. Je prévoyais ni plus ni moins que l'essentiel des contributions seraient le fait de super-bots :
Les bots représentaient désormais près de 99,5% des contributions. Mis au point en 2036, le programme SC, ou synthèse-conversant remplaçait adéquatement la plupart des interventions humaines. Les bots pouvaient synthétiser n’importe quel texte de référence. Ils étaient capables de justifier leur modifications et d’en discuter avec n’importe quel intervenant humain.

samedi 30 juin 2012

Bibliographies

Comme je viens de le signaler sur ma page de discussion, je suis en vacances depuis ce matin. Wikitrekk risque donc de somnoler un peu pendant les deux semaines à venir — à moins que mon collègue n'entreprenne de le nourrir un peu.

 En dépit des divers préparatifs de départs, qui ont d'ailleurs sévèrement amoché mon editcount de ces derniers jours, je n'ai pas raté cet intéressant message d'Ironie sur le bistro d'hier :
Aux adeptes d'affaires bibliographiques, je signale mes premiers tests pour l'importation des liens vers les notices d'autorités bibliographiques de quelques grandes bibliothèques. En débutant avec l'importation des Autorités des 220'000 articles de la Wikipédia allemande et les services OCLC. Premier test : diff Débat technique Discussion Modèle:Autorité. J'ai idée que Wikidata gèrera certainement les Autorités (OCLC a proposé l'importation sur Wikidata), mais comme c'est pas encore sur le planning des devs et qu'il faudra peut-être attendre des années...
De quoi s'agit-il ? D'ajouter les principaux identifiants bibliographiques affectés à un auteur (dans le jargon des bibliothécaire on parle d'autorité) sur chaque article correspondant. Ainsi, l'article sur André Breton comporte désormais une courte fiche reprenant ses notices d'autorité sur la BNF, le VIAF et le SUDOc :


Ce type de fiche est courant sur la Wikipédia germanophone. Il devrait rapidement se généraliser sur la Wikipédia francophone. Plus de 200 000 articles vont bientôt s'en voir équipé.

 L'intérêt de cet ajout est évident. Cela permet de formaliser plus aisément les bibliographies internes aux articles (on a tout de suite sous la main une liste des œuvres produites par untel). Ensuite, cela améliore l'accessibilité des sources. Le contributeur peut facilement naviguer depuis l'article encyclopédique vers le SUDOC et trouver ainsi une source liée dans sa bibliothèque la plus proche.

 Cette initiative m'a fait penser à une idée un peu similaire, qui germe dans ma tête depuis quelques jours. Suivant l'exemple donné par Hégésippe, j'ai commencé à recenser les titres de ma bibliothèque dans le logiciel Calibre. Pour ce faire, il suffit de renseigner l'ISBN de chaque titre. Le logiciel se charge ensuite de récupérer les métadonnées sur Worldcat. On arrive ainsi à ce genre de choses :


Dès lors idée serait la suivante : mettre en place une sorte de Calibre commun sur Wikipédia. Chaque wikipédien y exporterait les métadonnées de sa bibliothèque. Un champ utilisateur permettrait de recenser le pseudo des utilisateurs qui détiennent la référence cherchée. Il suffirait de le contacter ce détenteur pour obtenir telle ou telle information qui y serait présente, afin de rédiger une note de bas-de-page bien proprette :


Quelques projets ont déjà mis en place un système similaire, quoique d'ampleur plus limitée. Je me souviens notamment d'une belle liste de référence par détenteur liée au projet Hellénopédia mais je n'arrive pas à remettre la main dessus…

mardi 26 juin 2012

Petite utopie du mardi matin…

Comme vous vous en êtes sans doute aperçu, Wikisource a généralisé depuis déjà quelque temps (environ deux ans ?) le principe de la lecture en regard. Concrètement, le dispositif permet de découvrir côte-à-côte l'œuvre retranscrite par un wikisourcien (et à ce titre, facilement transportable et manipulable) et un scan d'une édition de l'œuvre tombée dans le domaine public. Ce dispositif est diablement efficace. Il permet de constater immédiatement si la retranscription est exacte ou non, et, éventuellement, de corriger en conséquence (ce qui m'est d'ailleurs arrivé à plusieurs reprises). C'est un gage formidable de fiabilité.

La Contribution à la critique de l'économie politique de Marx face au scan de son édition de 1909 

En quoi consisterait dès lors ma petite utopie du mardi matin ? A installer un dispositif assez similaire sur Wikipédia.

Comme je l'ai déjà antérieurement souligné, la rédaction des articles encyclopédiques présuppose le recours à des sources fiables. Or, rien ne garantit que les contenu des sources ait été bien synthétisé. Rien ne garantit non plus que le renvoi soit rigoureusement exact (même le rédacteur le plus scrupuleux doit sans doute se tromper ponctuellement de page…). Pour le vérifier, il n'y a pas 36 solutions : consulter la source utilisée chez soi, si on l'a, ou se déplacer en bibliothèque. La plupart du temps, on doit se reposer sur l'apparente scientificité du paratexte — par exemple écrire R. T. Bidule, La dialectique quantique, Oxford, 2003, ça en jette d'un point-de-vue purement connotatif….

Mon idée serait la suivante : développer un système de lecture en regard entre un article de Wikipédia et sa source originelle. En cliquant sur une source dûment annotée on déclencherait aussitôt l'ouverture de la publication d'origine, tout en continuant de survoler l'article encyclopédique censé en faire état. On aboutirait à la modélisation suivante :

Système de double lecture hypothétique sur l'article Origine de la monnaie
Techniquement, l'on s'en doute, rien ne s'y oppose. Le véritable hic est d'ordre légal. L'essentiel des publications utilisées comme sources secondaires sur Wikipédia sont encore protégées par le droit d'auteur. Et lorsqu'elles ne le sont pas, les licences ne sont guère accueillantes (Persée, par exemple, héberge sous NC…). Etant donné le mouvement de fronde existant contre les éditeurs de revues, la Wikimédia Foundation aurait peut-être l'opportunité de développer des partenariats allant dans ce sens.

Bon, soyons réaliste, ce n'est pas encore demain le veille que tout ceci se réalisera — c'est un peu le principe des utopies… En attendant, je renouvelle mes félicitations à nos amis wikisourciens qui, contexte légal aidant, font un peu figure de pionnier en la matière.

vendredi 22 juin 2012

Où en est Wikidata ?

Ça fait quelque temps que je me dis que je devrais faire un truc sur Wikidata. Je m’étais un peu impliqué dans les questions relatives aux traitements de données encyclopédiques en début d’année. J'avais d'ailleurs commencé à rédiger un billet sur le sujet en mars, sans avoir eu le temps de le terminer. Vu que quasiment toutes les informations qu'il contient ont été médiatisées, je préfère aborder le sujet par un autre biais.

Le projet Wikidata a pas mal progressé depuis son lancement. On trouve sur le site pas mal de précisions intéressantes, qui n’ont pas forcément été relayés en français.

A mon avis, la page la plus intéressante concerne la définition du Data model, soit le mode de présentation des données. Cette définition n’est pas d’ordre technique, mais d’ordre épistémologique et intéresse à mon avis directement les contributeurs de Wikipédia, indépendamment de leurs compétences informatiques. Je ne m’en tiendrai ici qu’à la définition relativement simple présentée dans l’Overview. Il va sans dire que, concrètement, les choses sont beaucoup plus complexes — je m’excuse par avance si je simplifie à outrance les procédés réellement utilisés.

La grammaire wikidatienne repose sur une vision dénotative du langage. En lieu et place des mots, on trouve des items, soit des symboles purement référentiels. On donne ainsi pour exemple la ville de Berlin qui renvoie sans ambiguïté possible à une entité humaine unique, correspondant à un territoire strictement défini. Toutes les mots n’ont malheureusement pas la même portée référentielle. Outre, les homonymes, il y a aussi les termes et concepts flottants, généralement difficiles à traduire d’une langue à l’autre. Créer un item à partir de socialisme ou de culture risque de poser quelques difficultés.

A chaque item correspond une liste de statements. Chaque statement prétend reproduire un état de la réalité, au sens où l’entendait Wittgenstein.
La proposition construit un monde au moyen d'un échafaudage logique, et c'est pourquoi l'on peut voir dans la proposition, quand elle est vraie, ce qu'il en est de tout ce qui est logique. On peut d'une proposition fausse tirer des inférences (Tractatus Logico-Philosophicus, 4.023)
Le Statement se décompose en valeur (value) et en propriété (property). La value exprime « un nombre, une date, des coordonnées géographiques et plein d’autres choses ». Elle donne une indication de mesure qui permet de cerner une proportionnalité (x=n) ou une situation (x se trouve sur n). Chaque valeur est rattachée à une propriété. Cette dernière spécifie une qualité de l’item. Ainsi, sous l’item Berlin, on trouve la propriété population, à laquelle correspond la valeur 3 499 879.

Jusqu’ici les choses sont relativement simples. Les relations entre les trois signes fondamentaux permettent d’emblée d’exprimer certains énoncés relativement simples. Avec item=Berlin, property=population et value=3 499 879, on peut générer une phrase comme « Berlin compte 3 499 879 habitants ».

Là où ça se complique un peu, c’est que nos trois signes se combinent pour former de nouveaux signes. Le lien entre propriétés et valeur s’exprime au travers d’un datatype. A côté de la propriété population, on trouverait ainsi un datatype=people. Le datatype assure ainsi une fonction d’appariement : il permet d’éviter de mêler indistinctement la population de Berlin avec les coordonnées géographiques de Paris.

En outre, les propriétés ne comportent pas obligatoirement de valeurs. Le cas échéant, elles constituent des snaks, soient de simples qualifications qui améliorent la précisions des énoncés. A partir du snak commune ou cité, on génère ainsi des phrases comme : « la ville de Berlin compte 3 499 879 habitants ». On évite ainsi les confusions entre ville et agglomération urbaine.

Arbre des Snaks sur Wikidata (CC/BY/SA : http://meta.wikimedia.org/wiki/Wikidata/Data_model#Snak)
Ces données n’échappent bien entendu aux principales règles encyclopédiques. Suivant en cela les prescriptions de la Neutralité de point-de-vue, elles seront référencées à partir d’un champ intitulé ReferenceRecord.

Ces combinaisons syntaxiques permettent de produire des énoncés considérablement plus complexe. Rien ne s’oppose ainsi à ce que la phrase suivante, présente dans le résumé introductif de l’article Paris, ne soit généré par Wikidata :

Ici, Paris figure l’item. Le recensement de l’Insee et la note de bas-de-page qui l’accompagne sont du ressort du ReferenceRecord. La date (1er janvier 2009) et la population (2,2 millions d’habitants) résultent d’autant de combinaisons propriété-valeur. Enfin, la précision « commune de » constitue un snak.

Comme toute logique formelle, cette grammaire wikidatienne est universellement traduisible. Pour reprendre à nouveau Wittgenstein :
La traduction d'une langue dans une autre ne se produit pas par la traduction d'une proposition de l'une dans une proposition de l'autre ; seuls sont traduits les constituants de la proposition (Tractatus Logico-Philosophicus, 4.025)
Le transfert peut ainsi fonctionner dans les deux sens : traduction vers, et traduction à partir de. Concrètement, la phrase citée plus haut de l’article Paris est aspirée par la base de donnée. Chacun de ces composants reçoit une affectation sur Wikidata. Ce transfert devrait se passer sans encombre pour les énoncés déjà intégré dans un modèle — il va sans dire que tout ce qui se trouve dans un modèle débarque ipso facto dans ReferenceRecord. Par contre, la transcription des énoncés nus devraient peut-être poser un peu plus de souci (dans « la commune de Paris », il n’est pas forcément évident de repérer l’item et le snak).

La traduction à partir de pose sans doute moins de soucis. Il s’agit de transporter les statements stockés par Wikidata dans une langue naturelle, en recourant aux tournures usuelles employées, par exemple, pour énoncer la population d’une ville. On mesure tout de suite l’importance de ce type de génération textuelle pour les petits wikis, qui ne disposent pas d’une communauté suffisamment importante pour recueillir manuellement certaines informations essentielles. Dans une hypothétique Wikipédia syldave on pourrait ainsi retrouver :

Sous réserve de réaliser toutes ses promesses, Wikidata peut avoir une certaine incidence sur la dissémination du savoir en France. Le développement des wikipédias en langues régionales ou dans les langues d’outre-mer (Wikimédia France s’était dernièrement beaucoup investit dessus) ne pourra qu’en être facilité.