Quel statut pour les données de la recherche après la loi numérique ? –

Quel statut pour les données de la recherche après la loi numérique ?

Publié le 3 novembre 20164 novembre 2016 par calimaq

Ce billet est le troisième d’une série que j’ai entamée au début de la semaine pour cerner les répercussions de la loi « République numérique » sur le secteur de l’Enseignement supérieur et de la Recherche. Après avoir commencé lundi à passer en revue le volet Open Access de la loi, je me suis penché sur la question de l’ouverture des données publiques et sur la manière dont les universités ont été intégrées dans le principe « d’Open Data par défaut » instauré par le texte. Cela concerne au premier chef les données administratives de ces établissements- celles produites par leurs services centraux et communs -, mais je terminais en posant la question de savoir dans quelle mesure les données de la recherche allaient être impactées (ou non) par ces nouvelles obligations de publication en Open Data.

data

C’est ce sujet que je vais traiter dans ce troisième billet, en élargissant la perspective pour essayer de montrer en quoi la loi « République numérique » a commencé à mettre en place un statut juridique spécifique pour les données de la recherche. Vous allez voir que les répercussions potentielles de la loi sont profondes en la matière, même si le texte contient quelques zones d’ombre qui rendent encore assez imprévisibles ses effets à long terme.

Par « données de la recherche » – notion complexe à définir -, je n’entendrai pas les données sur la recherche (qui cherche sur quoi ? avec quels financements ? etc.), qui relèvent des données administratives et donc du nouveau principe d’Open Data par défaut, mais les données résultant directement des activités de recherche, produites par les chercheurs.

L’ébauche d’un statut spécifique pour les données de recherche

Il faut faire une lecture combinée de plusieurs articles de la loi numérique pour apercevoir dans le texte l’ébauche d’un statut juridique des données de recherche. L’article 38 – celui qui consacre une nouvelle exception au droit d’auteur en faveur du Text et Data Mining – contient à ce propos une précision intéressante. Le texte aborde en effet la question de la conservation des fichiers qui sont produits dans le cadre de ce type d’activités de recherche et il prend la peine d’indiquer la chose suivante :

[…] ces fichiers constituent des données de la recherche.

Cette phrase peut paraître à première vue assez anodine, mais elle signifie en réalité que les « données de la recherche » vont à présent constituer une nouvelle catégorie juridique au sens propre du terme, avec des conséquences en terme de régime applicable. C’est un premier indice qui nous montre que la loi a introduit un « statut » spécifique pour les données de la recherche, même si comme vous allez le voir, il faut produire un effort d’interprétation conséquent pour cerner exactement en quoi il consiste.

Une protection puissante contre la captation par les éditeurs

A l’article 30 de la loi numérique – celui consacré à l’Open Access -, on trouve les premiers éléments de réponse. C’est là que la loi consacre un nouveau « droit d’exploitation secondaire » au profit des chercheurs leur garantissant la possibilité d’auto-archiver leurs écrits, en dépit des clauses des contrats d’exclusivité qu’ils auraient pu signer avec des éditeurs, au terme d’un délai de 6 à 12 mois selon les disciplines.

Mais le texte contient aussi un passage sur les données de la recherche, qui instaure un mécanisme de protection contre leur captation par les éditeurs scientifiques :

L’éditeur d’un écrit scientifique mentionné au I ne peut limiter la réutilisation des données de la recherche rendues publiques dans le cadre de sa publication.

Les dispositions du présent article sont d’ordre public et toute clause contraire à celles-ci est réputée non écrite.

Ce passage répond à une inquiétude grandissante dans les milieux académiques face aux pratiques des éditeurs vis-à-vis des données de recherche. Ces derniers – et notamment les plus puissants du secteur, type Elsevier ou Springer – ont commencé à inciter ces dernières années les chercheurs à publier non seulement le texte de leurs publications, mais aussi des matériaux complémentaires (complementary material), constitués en général par les jeux de données brutes ayant permis d’élaborer les résultats faisant l’objet de la publication. Grâce à leur position dominante, ces acteurs étaient donc en mesure d’emmagasiner peu à peu de grands volumes de données de recherche, soumises aux mêmes clauses d’exclusivité que les articles. Dès lors, le même phénomène de privatisation qui a frappé les écrits scientifiques était en train de se reproduire pour les données de recherche, avec à terme le risque pour les universités d’avoir à racheter aux éditeurs l’accès aux données que la communauté des chercheurs avaient produites.

Pour parer à ce danger, la loi numérique a prévu un mécanisme de protection assez similaire à celui du droit d’exploitation secondaire sur les écrits, même si on va voir qu’il est en réalité plus puissant dans ses effets. Le principe sera dorénavant que l’éditeur ne pourra plus « limiter la réutilisation des données de la recherche rendue publiques [accompagnant un écrit] dans le cadre de sa publication« . Cela signifie que, quand bien même des contrats contenant des clauses d’exclusivité seraient signés par les chercheurs, celles-ci seraient privées par la loi de toute validité. Plus encore, si l’éditeur rassemble ces informations fournies par les chercheurs dans une base de données, les Conditions Générales d’Utilisation (CGU) – qui ont une valeur contractuelle – ne pourront pas non plus empêcher la réutilisation des données de recherche. Elles doivent pouvoir en être librement extraites pour réutilisation. Sur ce dernier point, il faudra cependant attendre pour y voir plus clair les dispositions du décret d’application de l’article 38 de la loi sur le Text et Data Mining, qui doit déterminer les « conditions dans lesquelles l’exploration des textes et des données est mise en œuvre« .

On a donc ici un puissant mécanisme contre la captation à titre exclusif des données de la recherche par les éditeurs scientifiques, et on notera que par rapport au droit d’exploitation secondaire sur les écrits, ce dispositif de neutralisation des clauses contractuelles possède un effet immédiat. Il n’y a pas de durée d’embargo destinée à garantir une période d’exploitation commerciale exclusive pour l’éditeur. Les donnés de recherche sont en quelque sorte « immunisées » dès leur publication à toute tentative d’enclosure (pour employer un terme tiré de la théorie des Communs).

Puissante dans ses effets, cette disposition est cependant limitée dans son périmètre d’application. Notamment, elle n’est opposable qu’aux « éditeurs » d’un écrit scientifique auquel des données sont associées. Or on aurait aimé qu’elle puisse l’être également à des acteurs comme les réseaux sociaux numériques, type Academia ou Research Gate qui, déjà avides des données personnelles des chercheurs, pourraient très bien à terme aussi développer un appétit pour les données de la recherche. Et on sait aussi que certaines plateformes de diffusion des données de recherche sont contrôlées en réalité par des éditeurs (comme Figshare par exemple, qui est la propriété de Macmillian Publishers). Il aurait donc mieux valu que la protection conférée par l’article 30 soit formulée de manière plus générale pour être opposable à n’importe quel type d’acteurs, et pas uniquement aux éditeurs.

Mais moyennant ces réserves, on peut considérer que la loi numérique a posé des garde-fous précieux contre ce qui pourrait constituer dans les années à venir un grave problème pour l’écosystème de la recherche. Les éditeurs pourront tout à fait continuer à développer des activités autour des données de la recherche, mais ils devront fonder leurs modèles économiques sur de véritables services à valeur ajoutée. Ils ne pourront pas se contenter d’utiliser leur position dominante pour en revendre l’accès (à condition toutefois que se développe en parallèle une véritable politique publique d’infrastructures pour l’archivage et la diffusion des données scientifiques pour empêcher la constitution d’un monopole de fait. Mais c’est justement ce que la loi rend possible, en interdisant aux éditeurs de s’approprier en amont les données à titre exclusif).

Des données de recherche « libres » dès la publication

Pour revenir à l’article 30, on va voir à présent qu’il va créer une « condition juridique »originale pour les données de recherche et très différente de celle des articles scientifiques.

On sait en effet que les chercheurs constituent des agents publics qui ont la particularité de conserver pleinement leur droit d’auteur sur les œuvres qu’ils produisent dans le cadre de leurs fonctions (contrairement aux autres agents publics, dont les droits patrimoniaux sont exercés par leurs tutelles et dont le droit moral est réduit au droit à la paternité).

Une des conséquences secondaires de cette titularité individuelle des droits pour les chercheurs sur leurs écrits est que ceux-ci ne deviennent pas automatiquement réutilisables lorsqu’ils choisissent de les publier en ligne dans des archives ouvertes ou sur un site personnel. Le droit d’auteur qui s’applique à eux est pleinement maintenu lors de la diffusion sur Internet. C’est le cas par exemple pour un article déposé par un chercheur sur HAL ou dans une archive ouverte institutionnelle : par défaut, si le chercheur ne fait rien d’autre que le déposer, l’article sera librement accessible, mais pas librement réutilisable. Il ne le deviendra que si le chercheur choisit d’opter par un acte positif pour une licence Creative Commons (ce que la plate-forme HAL permet depuis le passage à la v3).

Cet état de fait justifie aux yeux de certains que l’on fasse une distinction entre « l’Accès ouvert » et « l’Accès libre », les deux expressions renvoyant à deux réalités différentes. C’est notamment une précision que rappelle régulièrement Marin Dacos (et encore récemment dans la préface de la traduction d’un ouvrage de Peter Suber, dont voici un extrait) :

Le terme open signifie « ouvert », et non « libre ». Il implique donc que le texte d’un article en open access est ouvert en lecture, sans barrière juridique, technique ou commerciale. Mais il ne dit rien des possibilités de réutilisation du document. Par conséquent, stricto sensu, l’open access lève les barrières à l’accès et maintient toutes les protections du droit d’auteur sur les textes, ce qui signifie qu’ils ne peuvent être reproduits ou modifiés qu’après une autorisation explicite, dans le cadre d’un contrat de cession de droit.

Or c’est précisément une distinction qui n’aura à présent plus de sens à propos des données de la recherche : des données publiées par un chercheur ou un établissement deviendront instantanément réutilisables librement, si bien que l’accès ouvert sera aussi synonyme d’accès libre.

C’est ce qui ressort notamment de ce passage de l’article 30 de la loi :

Dès lors que les données issues d’une activité de recherche financée au moins pour moitié par des dotations de l’Etat, des collectivités territoriales, des établissements publics, des subventions d’agences de financement nationales ou par des fonds de l’Union européenne ne sont pas protégées par un droit spécifique ou une réglementation particulière et qu’elles ont été rendues publiques par le chercheur, l’établissement ou l’organisme de recherche, leur réutilisation est libre.

« Leur réutilisation est libre ». La formule peut paraître lapidaire, mais elle n’en a pas moins d’importantes conséquences sur le plan juridique. Ces termes doivent être pris au sens de la lettre : la réutilisation est complètement libre, à toutes fins (y compris commerciales) et sans condition (pas même celle de citer la source).

On peut en déduire (et c’est assez révolutionnaire) que la loi numérique va rendre inutile le recours aux licences libres pour la diffusion des données de la recherche. On sait que pour encadrer l’ouverture des données publiques en France, l’Etat a créé la Licence ouverte / Open Licence (qui permet la réutilisation des informations à toutes fins, à condition d’en citer la source). D’autres licences, comme l’ODbL ou les licences Creative Commons, sont également utilisables en matière d’ouverture de bases de données. Or pour les données de recherche, de tels instruments sont à présent inutiles, car c’est la loi directement qui instaure à leur sujet un droit de libre réutilisation dès lors qu’elles sont publiées.

On peut même aller plus loin en disant qu’il ne faut pas utiliser ces outils pour diffuser des données de recherche, car ces différentes licences comportent des conditions de réutilisation plus restrictives que le droit de libre réutilisation totale prévu par la loi. Or ces clauses (BY/NC/ND/SA) n’auront plus d’effet utile en raison du caractère d’ordre public des dispositions de l’article 30. La seule licence dorénavant compatible avec le régime légal des données de recherche est la CC0.

En cela, ce texte innove réellement, car c’est à ma connaissance un des seuls cas où la loi française va créer du « libre à l’état natif », sans avoir besoin de recourir à des licences pour opérer cette libération. Les dispositions de la loi se déclenchent automatiquement par l’acte de publication (et vous noterez d’ailleurs que le texte ne parle pas de publication « en ligne », mais simplement de publication, ce qui couvre des hypothèses plus larges, comme la diffusion via une base de données commerciale).

Quelles limites à la libre réutilisation ?

Néanmoins, il faut immédiatement préciser que l’article 30 a prévu de limiter son périmètre d’application, en excluant certains types de données de cet effet de « libération immédiate ». Il indique en effet que la réutilisation est libre , sauf si les données « sont protégées par un droit spécifique ou une réglementation particulière« .

Cette précision peut paraître à première vue assez sibylline, mais elle est en réalité parfaitement logique. On peut en effet penser à des données correspondant à des informations à caractère personnel, qui sont protégées par une « réglementation particulière ». Si c’est le cas, alors bien évidement, leur réutilisation ne sera pas libre, mais soumise à ce que prévoit la législation en la matière.

On peut aussi penser également au droit à l’image des personnes, qui constitue un « droit spécifique ». Celui-ci ne cédera pas du fait que des matériaux serait utilisés à des fins de recherche. Il est donc normal que le législateur ait prévu ces restrictions à la libre réutilisation des données de recherche, qui permettent de concilier des principes d’égale valeur.

Quid de l’articulation avec les droits de propriété intellectuelle ?

Mais la question devient plus épineuse si l’on entend par « droits spécifiques » des droits de propriété intellectuelle. Cela entre d’ailleurs manifestement dans l’intention du législateur, puisque ces droits sont visés dans l’exposé des motifs de la loi :

Le II spécifie que la réutilisation de données issues d’activité de recherche financées majoritairement sur des fonds publics est libre, dès lors que ces données ne sont pas protégées par un droit spécifique, comme par exemple un droit de propriété intellectuelle, et qu’elles ont été rendues publiques par le chercheur ou l’organisme de recherche.

Si par droit de propriété intellectuelle, on entend le droit d’auteur, alors les choses sont somme toute logiques encore, notamment afin de préserver les droits des tiers. Imaginons qu’un corpus de recherche contienne des documents protégés par des droits d’auteur (par exemple, un ensemble de textes littéraires). Si ce corpus est publié, alors bien entendu, il ne peut devenir ipso facto librement réutilisable. Pour être plus exact, il sera réutilisable dans une certaine mesure, sur le fondement de l’exception Text et Data Mining prévue à l’article 38 de la loi, mais pas sur celui du droit de libre réutilisation des données de la recherche figurant à l’article 30.

Le vrai problème que pose l’articulation de cet article 30 avec les droits de propriété intellectuelle se situe en fait au niveau du droit des bases de données. Imaginons qu’un chercheur ou un établissement publie un jeu de données sur lequel porte un droit sui generis de producteur de base de données. On a alors bien affaire à un objet protégé par un « droit spécifique » et dans ce cas, ce jeu ne devrait pas devenir « librement réutilisable », si l’on s’en tient à la seule lecture de l’article 30.

Si l’on admet une telle interprétation, la portée de ce droit de libre réutilisation des données de la recherche serait en réalité bien limitée, car dès lors que des jeux de données sont un peu conséquents, la protection du droit des bases de données leur sera sans doute applicable. Par ailleurs, l’application de l’article deviendrait aussi très incertaine, car le droit de producteur des bases de données est souvent aléatoire dans sa mise en œuvre. La jurisprudence est en effet fluctuante sur la question et il n’est pas simple a priori de déterminer si telle ou telle base bénéficie ou non de la protection.

Mais vous allez voir l’obstacle à la libre réutilisation que pourrait constituer le droit des bases de données n’est en réalité pas insurmontable.

Qui est réellement titulaire des droits sur les données de recherche ?

Pour démêler cette question, il faut se demander à qui appartient réellement la propriété sur les données de recherche. Et le raisonnement à suivre pour répondre est là encore complètement différent de celui applicable aux articles.

En effet, pour les écrits scientifiques, les chercheurs sont incontestablement titulaires du droit d’auteur. Ce qui signifie que même si un chercheur produit des écrits sur son temps de travail et avec les moyens fournis par une université, il reste entièrement maître du droit sur ses créations, et c’est lui qui décide où et comment publier ses écrits.

Or pour les bases de données, les choses sont différentes. Même si ce sont les chercheurs qui produisent les données figurant dans ces bases, la titularité des droits peut – et même va dans la plupart des cas – leur échapper. En effet, le Code de propriété intellectuelle prévoit que la notion de producteur d’une base de données ne s’entend pas des personnes physiques qui collectent et traitent les informations, mais de la personne – physique ou morale – qui « prend l’initiative et le risque des investissements correspondants » et en retour « bénéficie d’une protection du contenu de la base lorsque la constitution, la vérification ou la présentation de celui-ci atteste d’un investissement financier, matériel ou humain substantiel« .

C’est donc vers le financeur et le fournisseur de moyens qu’il faut se tourner pour déterminer qui est titulaire des droits sur une base de données de la recherche. Dans la plupart des cas, ce seront donc les établissements auxquels les chercheurs sont rattachés qui bénéficieront de ces droits et non les chercheurs. Contrairement à ce qui prévaut pour les articles et autre écrits scientifiques, les bases de données appartiennent donc en principe aux institutions de recherche.

Sans doute faut-il nuancer quelque peu cette affirmation. Imaginons un chercheur qui publie un article dans une revue et qui lui adjoint un tableau de données brutes lui ayant servi à arriver aux résultats faisant l’objet de la publication. Dans ce cas, il est possible que le chercheur soit la personne qui a réalisé les « investissements » nécessaires – sur ses propres forces – pour produire ces données. Mais quand bien même, il est fort improbable que de tels investissements individuels soient considérés comme « substantiels » au sens de la jurisprudence et ce tableau ne constituera vraisemblablement pas une base de données protégée. Donc il y a peu de chances qu’un chercheur isolé puisse être considéré comme un « producteur de base de données », au sens juridique du terme.

Imaginons à présent une base de données produite collaborativement et maintenue par les chercheurs d’un laboratoire ou une base de données développée spécifiquement dans le cadre d’un projet de recherche majoritairement financé par de l’argent public. Alors c’est l’employeur des chercheurs qui sera vraisemblablement titulaire des droits de producteur de base de données, car c’est lui qui assure les investissements nécessaires à la production de la base.

Or si c’est l’université qui est titulaire ab initio des droits sur une base de données scientifiques, cela aura d’importantes conséquences du point de vue de la loi numérique. Pour le comprendre, il faut vous reporter au billet précédent que j’ai écrit sur l’Open Data et les universités, car vous allez voir que cette question rejoint en définitive celle des données de la recherche.

Le droit des bases de données des universités est neutralisé par défaut

En effet, l’article 11 de la loi numérique contient une disposition qui neutralise le droit des bases de données dont pourrait bénéficier les administrations soumises au principe d’Open Data par défaut (ce qui est le cas des universités) :

Sous réserve de droits de propriété intellectuelle détenus par des tiers, les droits des administrations mentionnées au premier alinéa de l’article L. 300-2 du présent code, au titre des articles L. 342-1 et L. 342-2 du code de la propriété intellectuelle, ne peuvent faire obstacle à la réutilisation du contenu des bases de données que ces administrations publient en application du 3° de l’article L. 312-1-1 du présent code.

Donc on peut en déduire que si une université est titulaire d’un droit de producteur de base de données scientifiques, alors elle ne peut opposer ce droit à la réutilisation des informations qu’elle contient. Cela revient dès lors à dire que la réutilisation de ces données de recherche, nonobstant le droit de producteur de base de données, est bien « libre ».

Et nous rebouclons ici avec l’article 30 et son droit de libre réutilisation des données de recherche. De tout ce qui précède, nous pouvons conclure que l’article 30 nous dit bien que le droit de libre réutilisation des données de recherche ne vaut pas lorsque celles-ci sont protégées par un « droit spécifique », mais comme je viens de le montrer, cela ne peut concerner le droit de producteur de base de données qui, de toutes façons, est neutralisé en vertu de l’article 11 et ne peut être opposé à la libre réutilisation.

La conclusion est donc la suivante : des données de la recherche publiées par un chercheur ou un établissement seront donc bien librement réutilisables, sous réserve de respecter la législation sur les données personnelles ou le droit à l’image, ainsi que le droit d’auteur des tiers.

Reste alors une ultime question à considérer, car en définitive le seul moyen pour des chercheurs ou une institution d’empêcher la libre réutilisation de leurs données pourrait consister tout simplement à ne pas les publier. Mais vous allez voir qu’en réalité, ce choix-là n’existe pas non plus en vertu des dispositions combinées de la loi.

L’Open Data par défaut est applicable aux données de la recherche

Pour le comprendre, il faut revenir au principe d’Open Data par défaut que j’ai décrit dans le billet précédent. La loi numérique soumet dorénavant les administrations à l’obligation de publier de manière proactive et de rendre librement réutilisables un ensemble conséquent de documents et de données. C’est l’article 6 de la loi qui liste les informations concernées :

Sous réserve des articles L. 311-5 et L. 311-6 et lorsque ces documents sont disponibles sous forme électronique, les administrations mentionnées au premier alinéa de l’article L. 300-2, à l’exception des personnes morales dont le nombre d’agents ou de salariés est inférieur à un seuil fixé par décret, publient en ligne les documents administratifs suivants :
« 1° Les documents qu’elles communiquent en application des procédures prévues au présent titre, ainsi que leurs versions mises à jour ;
« 2° Les documents qui figurent dans le répertoire mentionné au premier alinéa de l’article L. 322-6 ;
« 3° Les bases de données, mises à jour de façon régulière, qu’elles produisent ou qu’elles reçoivent et qui ne font pas l’objet d’une diffusion publique par ailleurs ;
« 4° Les données, mises à jour de façon régulière, dont la publication présente un intérêt économique, social, sanitaire ou environnemental.

Comme vous le voyez, la loi impose la publication en ligne des « bases de données ». Cela signifie que si l’université est titulaire du droit de producteur de bases de données scientifiques développées en son sein (et nous avons vu dans la partie précédente que ce sera généralement le cas), alors elle devra les mettre en ligne en Open Data (à la seule réserve de la protection des données personnelles).

L’article précise aussi que les données présentant un intérêt « économique, sociétal, sanitaire ou environnemental » entrent dans le principe d’Open Data par défaut. Cela laisse une large marge d’interprétation pour déterminer ce qui rentre dans ce périmètre. Mais une recherche serait bien insignifiante si les données qu’elle produit ne comportant pas a minima un intérêt « sociétal » et dans certains secteurs, ces informations revêtiront aussi un intérêt économique, environnemental ou sanitaire.

La conclusion de tout ceci – et je pense que les autorités de la recherche sont très loin de l’avoir suffisamment perçu -, c’est que la loi numérique va avoir des effets de levier très puissants sur la diffusion des données de la recherche en France. Là où les chercheurs ont gardé la faculté de décider s’ils publient ou non leur écrits en Open Access, ils l’ont manifestement perdue pour les données la recherche. Les universités dont ils dépendent ont à présent l’obligation de publier en ligne les données de la recherche produites en leur sein, et une fois publiées, ces données deviennent ipso facto librement réutilisables (sous la réserve – importante – de la protection des données personnelles et du respect des autres droits éventuels des tiers).

Dans l’hypothèse où les universités (ou les chercheurs) opposeraient une certaine inertie et ne respecteraient pas ces obligations de publication en Open Data, la loi n’a pas directement prévu de sanctions, mais il existera un mécanisme correctif assez facilement actionnable.

Le texte a en effet instauré un dispositif d’Open Data « à la demande » connecté au droit à la communication des documents administratifs. Si un individu, une association (ou même une entreprise) savent qu’un jeu de données de recherche existe, mais n’a pas encore fait l’objet d’une publication en Open Data, ils peuvent faire une demande de communication sur la base de la loi CADA. Si cette demande est fondée, l’université devra communiquer le document, mais aussi (s’il existe sous forme numérique), le mettre en ligne et rendre librement réutilisables les informations qu’il contient dans un format ouvert lisible par les machines.

Au cas où les établissements de recherche n’agiraient pas d’eux-mêmes pour se conformer aux obligations de la loi, il existera donc un moyen de faire bouger les lignes par le biais de demandes de communication.

Conclusion : Données de la recherche et Communs de la connaissance

Pour conclure, je voudrais revenir sur la généalogie de la phrase « leur réutilisation est libre » figurant à l’article 30 de la loi numérique, qui joue un rôle central dans ce nouveau statut des données de la recherche créé par le texte.

A l’origine, le gouvernement avait l’ambition d’introduire en droit français la notion de « domaine commun informationnel », en rattachant un certain nombre d’informations et de données à la notion de « choses communes » issue de l’article 714 du Code civil :

Il est des choses qui n’appartiennent à personne et dont l’usage est commun à tous.

Il se trouve que les aléas politiques – et une bonne dose de lâcheté gouvernementale – ont entraîné l’abandon de l’article 8 de la loi qui manifestait cette ambition. Mais après la phase de consultation en ligne, le texte a été réécrit et ce sont les données de la recherche que le gouvernement a voulu qualifier de « choses communes » :

Les données de la recherche rendues publiques légalement issues d’une activité de recherche financée au moins pour moitié par des fonds publics et qui ne sont pas protégées par un droit spécifique sont des choses communes, au sens de l’article 714 du code civil.

Le Conseil d’Etat s’est alors prononcé sur cette version et il a émis un avis défavorable à propos de cette rédaction (au motif qu’aucune étude d’impact n’avait été réalisée sur ce point précis…).

L’argument était bien faible, mais il a suffi à ce que le texte du projet de la loi soit encore été remanié, avant l’introduction au Parlement, et c’est là qu’est apparue la rédaction qui y figure encore : « leur réutilisation est libre« .

Le rattachement explicite des données de la recherche aux choses communes a donc été gommé au fil des versions successives, mais si l’on y réfléchit bien, le résultat final est exactement le même du point de vue des conséquences juridiques que cela emporte.

Car en effet, on peut tout à fait dire à présent que les données de la recherche « n’appartiennent à personne » : elles n’appartiennent pas aux chercheurs, car ce sont les universités qui détiennent généralement le droit de producteur de base de données sur elles. Mais celui-ci est neutralisé par l’article 11 de la loi, qui impose par ailleurs la mise en ligne proactive. Donc concrètement, les données ne sont soumises à aucun droit de propriété efficace.

Et j’ai montré que l’article 30 avait pour conséquence qu’une fois les données de la recherche publiées, leur usage devient pleinement libre et donc « commun à tous » (sous réserve de la préoccupation légitime de protéger les données personnelles et les droits des tiers).

Par ailleurs, ces données sont non seulement rendues librement réutilisables par l’effet de la loi, mais aussi protégées contre les phénomènes d’enclosure, comme je l’ai montré dans la première partie du billet à propos des mécanismes de défense vis-à-vis de la captation par les éditeurs. La liberté d’usage donnée par la loi ne peut être reprise par quiconque.

Donc la conclusion à laquelle nous devons aboutir, c’est que la loi numérique a bien créé un statut juridique remarquable pour les données de la recherche : elle en a fait des Communs de la connaissance.

13 réflexions sur “Quel statut pour les données de la recherche après la loi numérique ?”

Mathieu Saby (@27point7) dit :

4 novembre 2016 à 18:47

Bonjour
Concernant le droit sur les bdd, certes l’université ou les organismes seront « producteurs », mais il peut exister un droit d’auteur sur la structure même de la bdd, si elle est originale. Un simple tableau excel reprenant des champs très basiques ou conformes aux standards d’une discipline ne sera pas original, mais une bdd comme celle-ci http://siprojuris.symogih.org/siprojuris/enseignant/44315 qui a fait l’objet d’une modélisation avancée a bien un ou des auteurs, au sens du L.112-3 du CPI. Or, ne retombe-t-on pas dans le cas des articles, où les chercheurs gardent la propriété de leurs travaux?

Concrètement, ce projet comme bien d’autre est actuellement soumis à des conditions de réutilisation drastiques (http://siprojuris.symogih.org/siprojuris/mentions-legales). Idem pour cet autre source importante en histoire du droit (https://criminocorpus.org/fr/annexes/droits/). Est-ce qu’ils vont devoir les faire évoluer? Est-ce qu’un nouveau projet de ce type ne pourrait plus adopter de telles mentions légales? Franchement je suis peut-être pessimiste, mais j’ai des doutes sur l’effet magique de la la loi Lemaire sur cette question ;-)

Autre point: est-ce que la mention « mise à jour de façon régulière » dans « 3° Les bases de données, mises à jour de façon régulière » ne restreint pas cette obligation de mise en ligne à certaines bases de données de type administratif? Un grand nombre de jeux de données scientifiques ne sont pas « mises à jour de façon régulières » mais plutôt collectées plus ou moins ponctuellement.

M. Saby

Répondre
1. calimaq dit :
  
  4 novembre 2016 à 21:54
  
  Oui, la structure d’une base peut être originale et obtenir par ce biais la protection du droit d’auteur. Mais c’est alors bien seulement la structure de la base qui est protégée en tant que telle, et pas les données qui figurent à l’intérieur. Donc les données ne sont pas protégées « par un droit spécifique » (c’est la structure seulement qui l’est) et cela préserve à mon sens le droit à la libre réutilisation du contenu. On peut donc alors librement extraire les données et les réutiliser, mais pas copier la structure de la base pour en faire une autre.
  
  C’est vrai par contre que le « mise à jour de façon régulière » pourra peut-être jouer un rôle restrictif, mais c’est difficile à déterminer… Mais de toutes façons, même si cette piste des bases de données devait se fermer, il resterait possible de jouer sur les données présentant un intérêt économique, sociétal, environnement ou sanitaires, aussi listé à l’article sur l’Open Data par défaut.
  
  Donc oui, il y a des incertitudes, mais elles jouent dans les deux sens.
  
  Répondre
Karima Rafes dit :

12 novembre 2016 à 09:45

Pour information, l’université Paris Saclay commence déjà à partager ses données librement et de manière interoperable pour faciliter leurs réutilisations par les autres chercheurs. En espérant que cela inspire les autres universités…
https://io.datascience-paris-saclay.fr

Répondre
Pierre Naegelen dit :

3 mars 2017 à 18:41

Très similaires par leurs effets à la licence CC0, certaines CGU de plateformes hébergeant des données de la recherche précisent que ces dernières sont dans le domaine public. S’ajoute une contrainte, qui n’en est pas vraiment une, dans la mesure où elle est consubstantielle à la pratique de la recherche scientifique : il est demandé de citer explicitement la source en cas de réutilisation.

– National Center for Biotechnology Information (NCBI): »Information that is created by or for the US government on this site is within the public domain. Public domain information on the National Library of Medicine (NLM) Web pages may be freely distributed and copied. However, it is requested that in any subsequent use of this work, NLM be given appropriate acknowledgment. »

– Human Genome Project : »Unless otherwise noted, publications and webpages on this site were created for the U.S. Department of Energy Human Genome Project program and are in the public domain. Permission to use these documents is not needed, but credit the U.S. Department of Energy Human Genome Project and provide the URL http://www.ornl.gov/hgmis when using them. Materials provided by third parties are identified as such and not available for free use. »

Ces CGU me semblent compatibles avec le nouveau régime légal des bases de données en France.

Répondre
Pierre Naegelen dit :

3 mars 2017 à 18:42

Je voulais dire : « avec le le nouveau régime légal des données de la recherche en France »

Répondre
Pierre Naegelen dit :

4 mars 2017 à 09:46

L’Open Knowledge Foundation préconise dans les principes de Panton aussi bien l’emploi de la licence CC0 que de la licence ODC Public Domain Dedication and Licence (PDDL) :

« 4. Furthermore, in science it is STRONGLY recommended that data, especially where publicly funded, be explicitly placed in the public domain via the use of the Public Domain Dedication and Licence or Creative Commons Zero Waiver. This is in keeping with the public funding of much scientific research and the general ethos of sharing and re-use within the scientific community. Explicit dedication of data underlying published science into the public domain via PDDL or CCZero is strongly recommended and ensures compliance with both the Science Commons Protocol for Implementing Open Access Data and the Open Knowledge/Data Definition.“

A y regarder de plus près, la licence PDDL (https://opendatacommons.org/licenses/pddl/1-0/) précise que les conditions de son application ne neutralisent pas le droit des bases de données (« Database Rights only extend to the extraction and re-utilisation of the whole or a substantial part of the Data. Database Rights can apply even when there is no copyright over the Database. Database Rights can also apply when the Data is removed from the Database and is selected and arranged in a way that would not infringe any applicable copyright. »).

Cependant la licence CC0 précise pareillement que le droit des bases de données reste applicable :
« A Work made available under CC0 may be protected by copyright and related or neighboring rights (« Copyright and Related Rights »). Copyright and Related Rights include, but are not limited to, the following: (…) database rights (such as those arising under Directive 96/9/EC of the European Parliament and of the Council of 11 March 1996 on the legal protection of databases, and under any national implementation thereof, including any amended or successor version of such directive ».

Mais l’article 11 de la loi pour une République numérique bloque l’application du droit des bases de données pour les administrations. J’en conclus donc que la licence PDDL, tout comme la licence CC0, est compatible avec le nouveau régime légal des données de la recherche.

Répondre
1. calimaq dit :
  
  6 mars 2017 à 14:28
  
  Bonjour Pierre,
  
  Je suis d’accord avec toi et je pense que la CC0 est compatible avec le nouveau régime des données de la recherche issu de la loi numérique.
  
  J’ai un peu évolué cependant dans mon interprétation, depuis la rédaction de ce premier billet.
  
  Je pense en effet qu’il est possible de choisir la CC0 pour diffuser des données de recherche, mais que celles-ci ne sont pas automatiquement librement réutilisables (du moins totalement).
  
  L’article 30 de la loi numérique nous dit : « Dès lors que les données issues d’une activité de recherche financée au moins pour moitié par des dotations de l’Etat, des collectivités territoriales, des établissements publics, des subventions d’agences de financement nationales ou par des fonds de l’Union européenne ne sont pas protégées par un droit spécifique ou une réglementation particulière et qu’elles ont été rendues publiques par le chercheur, l’établissement ou l’organisme de recherche, leur réutilisation est libre. »
  
  Comme les données de la recherche sont des données publiques, « leur réutilisation est libre » doit s’interpréter au regard du droit à la réutilisation des données publiques.
  
  Or l’article L.322-1 du Code des relations entre le public et l’administration dit ceci : « Sauf accord de l’administration, la réutilisation des informations publiques est soumise à la condition que ces dernières ne soient pas altérées, que leur sens ne soit pas dénaturé et que leurs sources et la date de leur dernière mise à jour soient mentionnées. »
  
  A mon sens, cela signifie que des données de recherche peuvent être utilisées pour des données de recherche si les établissements le choisissent (le « sauf accord de l’administration » leur permet de lever notamment l’obligation de citer la source). Mais à défaut du choix d’une licence comme la CC0, le plancher de conditions fixées par cet article va continuer à s’appliquer.
  
  Dès lors l’article 30 de la loi numérique devrait s’interpréter ainsi : « Sauf si les établissements de recherche en ont décidé autrement, notamment en utilisant une licence comme la CC0, alors la réutilisation de données de recherche publiées est libre, sous réserve de mentionner la source et de ne pas les altérer ou les dénaturer ».
  
  Répondre
Ping: [TEST_CHANCE1_UE PRO_PAS RELU_PAS VALIDE] Big Data et données de la recherche
Ping: Evgeny Morozov et le « domaine public » des données personnelles – – S.I.Lex –
Ping: Quel cadre juridique pour la Science Ouverte ? Un aperçu des évolutions récentes. – – S.I.Lex –
Ping: La gestion des données de la recherche et leur diffusion, quels enjeux ?
Ping: Analyse du cadre juridique pour la Science Ouverte - Non classé La science ouverte pour tous ! %
Ping: OPEN DATA VS RGPD