Open Science Collaboration Network
Une plateforme open data gratuite qui transforme deux jeux de données publics — OpenAlex et CORDIS — en shortlists de partenaires de consortium EU, classées et scorées. Elle remplace deux à quatre semaines de recherche manuelle, biaisée par la proximité géographique, par une seule interface couvrant ~9 300 institutions réparties sur six thématiques de recherche
- Problème — Trouver des partenaires de consortium EU Horizon repose sur les réseaux personnels + Google : 2–4 semaines de travail, trop guidées par la proximité, sans preuve objective d’adéquation
- Insight — Le classement brut par publications place Harvard/MIT en tête de chaque thématique ; c’est en pondérant l’historique de projets EU + la position dans le réseau qu’on fait émerger les vrais candidats au consortium
- Solution — J’ai construit seule, de bout en bout, une plateforme open data (OpenAlex + CORDIS) qui score les institutions de 0 à 100 sur 6 dimensions, complétée par un graphe, une analyse des lacunes, une recherche sémantique et des synthèses IA
- Résultat — En production : 6 thématiques, ~9 300 institutions scorées, 800 000+ liens de collaboration, le tout pour €0/mois
La recherche de partenaires pour Horizon Europe repose entièrement sur les réseaux personnels — et ça se voit
Les subventions EU Horizon Europe (95,5 milliards d’euros sur 2021–2027) exigent presque toujours un consortium multinational d’au moins trois partenaires. La composition du consortium est un critère évalué et un motif de rejet fréquent. L’outil officiel — le Partners Search du EU Funding Portal — renvoie un répertoire de noms non classé, sans données de publications, sans contexte réseau et sans score d’adéquation. En dix ans, il n’a quasiment pas évolué.
Quatre entretiens semi-directifs avec des chercheurs ayant soumis des propositions Horizon ont révélé un flux de travail récurrent : (1) lister les organisations que le PI connaît déjà des conférences ; (2) passer Google Scholar au crible pour les affiliations ; (3) éplucher CORDIS à la main ; (4) solliciter les listes de diffusion. La proximité l’emporte — les organisations situées hors du réseau existant du PI n’avaient quasiment aucune chance de figurer sur la shortlist, quelle que soit leur adéquation réelle. Et les lacunes du consortium — l’organisme de politique manquant, l’ONG absente — se découvraient le plus souvent pendant la rédaction, au moment où elles coûtent cher à combler.
Le problème n’est pas un manque de données — OpenAlex comme CORDIS sont publics, complets et gratuits. Le problème, c’est qu’aucun outil ne les avait jamais réunis sous une forme réellement utile pour rechercher des partenaires
Partner Shortlist : institutions classées par Partner Fit Score composite, avec badge de type, pays, travaux et nombre de projets EU
Quatre points de friction — et un qui n’était pas au cahier des charges initial
La phase de découverte a combiné quatre méthodes : quatre entretiens semi-directifs de 45 minutes avec des parties prenantes, une analyse documentaire de 12 descriptions de projets Horizon financés (CORDIS), un audit concurrentiel du EU Funding Portal, de ResearchGate et d’ERAPortal, et une exploration technique pour valider la couverture et la qualité des données de l’API OpenAlex et du bulk-CSV CORDIS.
Friction 1 : la recherche dépend entièrement de ton réseau. Friction 2 : aucun signal quantitatif d’adéquation — les partenaires sont choisis sur la réputation et la confiance personnelle, pas sur des indicateurs mesurables. Friction 3 : les lacunes du consortium se découvrent tard, pendant la rédaction. Friction 4 : CORDIS est inutilisable sans outillage — les quatre personnes interrogées savaient qu’il existait ; aucune ne s’en servait régulièrement.
La Consortium Gap View ne figurait pas au cahier des charges initial. Elle est née directement de la friction 3 et fait aujourd’hui partie des écrans qui distinguent le plus nettement la plateforme d’un simple tableau de classement des institutions
Un classement brut par publications place Harvard en tête de chaque thématique — ce qui ne sert à rien
Le Partner Fit Score est un composite pondéré de 0 à 100 sur six dimensions : pertinence thématique (30 %), activité de publication (20 %), participation à des projets EU (20 %), centralité dans le réseau (15 %), diversité pays/consortium (10 %) et activité récente (5 %). Chaque composante est normalisée par rang percentile au sein de la cohorte de la thématique, et non divisée par le maximum — c’était l’erreur de la première version. Diviser par le maximum poussait ~86 % des institutions sous 30 et n’en laissait qu’une ou deux par thématique au-dessus de 70. La normalisation par percentile répartit les scores de façon vraiment significative sur toute la plage : ~150–315 institutions à forte adéquation par thématique en production.
Chaque score est stocké avec une décomposition JSONB par composante, pour que l’utilisateur voie exactement pourquoi une institution se classe là où elle se classe. La carte au survol dans la shortlist et le panneau de décomposition complet sur le profil de l’institution ne sont pas décoratifs — sans eux, le score paraît opaque et un chercheur n’agira pas en conséquence.
Profil d’institution — anneau de score + décomposition par composante
Consortium Gap View — verdicts de couverture par rôle standard
Limite assumée : l’entity matching est précis pour les universités et les instituts de recherche établis (noms stables, bien indexés) et plus faible pour les PME — pour l’adaptation climatique, environ 3 900 participations CORDIS ont été appariées à des institutions OpenAlex, tandis que ~3 570 sont restées sans correspondance. Le seuil confidence-75 accepte les correspondances floues limites comme « review-grade » ; tout ce qui passe en dessous est écarté plutôt que forcé. Pour le cas d’usage visé — identifier les partenaires leads d’un consortium —, c’est un compromis acceptable : les PME sont rarement leads, et la queue sans correspondance n’affecte pas le haut de la shortlist.
Cinq écrans pour les cinq étapes de la recherche de partenaires
La plateforme couvre tout le flux de recherche : Partner Shortlist (passage en revue des candidats avec filtres par pays, type et score minimum) → Profil d’institution (évaluation individuelle avec décomposition du score, principaux projets EU et communauté de co-auteurs) → Network Map (graphe force-directed Cytoscape.js, coloration par clusters Louvain, nœuds déplaçables) → Consortium Gap View (six cartes de rôles standards avec verdicts de couverture) → AI Strategy Brief (synthèse RAG Groq/llama-3.3-70b mise en cache depuis l’exécution ETL hebdomadaire). La recherche sémantique et le constructeur de consortium sont des ajouts transverses de la v2.

Live — six thématiques de recherche, ~9 300 institutions scorées, 800 000+ liens de collaboration
Network Map — clusters Louvain, layout force cola déplaçable
Constructeur de consortium — aperçu des lacunes en direct à mesure qu’on ajoute des partenaires
AI Strategy Brief — RAG sur les 15 premiers abstracts, généré dans l’ETL
Recherche sémantique — classement cosinus sur 6 000 abstracts de travaux intégrés
Batch-first : tous les calculs coûteux se font dans l’ETL, de sorte que l’API est en lecture seule et coûte €0
La décision d’architecture la plus importante est invisible pour l’utilisateur : tous les calculs — métriques de graphe, entity matching, scoring, embeddings, génération des synthèses IA — se font dans un traitement par lots hebdomadaire. L’API de production est une fine couche de lecture au-dessus de tables Postgres précalculées. Aucune opération coûteuse au moment de la requête ; aucun appel LLM sur le hot path. C’est aussi pourquoi la plateforme tourne pour €0/mois : tout est regroupé dans un seul conteneur Docker sur un hôte Coolify/Hetzner existant, où un thread interne de planification ETL hebdomadaire rend inutiles tout cron externe et toute base de données cloud managée.
Le problème d’ingénierie le plus ardu était l’entity matching entre CORDIS (numéros PIC) et OpenAlex (identifiants opaques) — aucun identifiant commun, seulement des noms d’organisations et des pays. Solution en trois couches : d’abord un blocage par pays (réduit l’espace de correspondance de ~95 %), puis une correspondance floue rapidfuzz token-set (≥90 acceptée d’emblée, ≥75 en review-grade), et enfin la ROR affiliation API uniquement pour la bande limite 75–90. Lancer le flou en premier a divisé les appels ROR par ~100 par rapport à la conception initiale, qui interrogeait ROR pour chaque organisation — ce qui provoquait des timeouts ETL. Pour éviter les deadlocks, il a fallu trier les upserts Postgres par openalex_id afin que les processus ETL parallèles prennent les verrous de ligne dans le même ordre.
La vue graphe s’adapte au mobile 390px — layout cola Cytoscape.js avec légende rétractable
En production, mesuré, honnête sur les limites
En juin 2026 : six thématiques de recherche en production, ~9 300 institutions scorées (21 000+ Partner Fit Scores institution-thématique), 800 000+ liens de collaboration, 6 000 travaux intégrés. Coût total d’infrastructure : €0. Temps de construction : sept mois en solo, de novembre 2025 au MVP en mai 2026, avec les fonctionnalités v2 en juin 2026.
Ce que je referais autrement : valider plus tôt la précision de l’entity matching. J’ai passé trois semaines à construire tout le pipeline avant d’en mesurer la précision. Une exploration de deux jours sur un échantillon de 200 organisations CORDIS aurait fait remonter plus tôt le problème de précision sur les PME et mené plus vite à une décision sur le seuil confidence-75. Un modèle de scoring n’est pas terminé quand la formule paraît sensée — seulement quand la distribution de sa sortie est réellement utile à la décision.
La leçon qui revenait sans cesse : vérifier les promesses des offres gratuites au regard de la réalité d’aujourd’hui, pas de la documentation. L’offre Postgres gratuite de Render supprime désormais la base de données après 30 jours. Chaque option managée gratuite cache une contrepartie. Héberge ta base de données toi-même
Sources
- Blondel, Guillaume, Lambiotte & Lefebvre (2008). Fast unfolding of communities in large networks (Louvain). J. Stat. Mech. P10008.
- Freeman (1977). A set of measures of centrality based on betweenness. Sociometry 40(1):35–41.
- Priem, Piwowar & Orr (2022). OpenAlex: a fully open index of scholarly works, authors, venues, institutions and concepts.
- ROR — Research Organization Registry.
- Reimers & Gurevych (2019). Sentence-BERT: sentence embeddings using Siamese BERT-networks.
