Parquet liés
Identifiants stables, références acceptées, IDs source et preuves restent joignables.
Infrastructure biomédicale ouverte pour agents + ML
Jouvence-Graph est construit pour les agents et le graph ML prédictif. Il combine un cœur dérivé d’Open Targets avec ontologies, interactions moléculaires, expression, régulation, pharmacologie et preuves cliniques — tout en conservant les identifiants source et la provenance.
Le produit data
Le graphe canonique vit dans des datasets Parquet liés, s’exporte relation par relation vers PyG et s’accompagne d’une couche d’inférence fail-closed qui ne compose que des relations biologiques approuvées. Les agents inspectent les mêmes contrats, manifestes et preuves que les modèles prédictifs.
Identifiants stables, références acceptées, IDs source et preuves restent joignables.
Edge indices par relation, node maps et manifestes permettent des chargements et training smokes bornés. Aucun entraînement multi-relation full-scale ni performance biologique n’est encore revendiqué.
Des chaînes versionnées et approuvées génèrent des candidats en conservant chemins de support et contraintes de fuite.
Docs, schémas et contrats indiquent quoi interroger, entraîner et ne jamais supposer.
Ce que vous pouvez faire
Partir d’une maladie, d’un gène, d’une protéine ou d’une molécule et suivre des relations biomédicales typées.
Inspecter la provenance, les scores, les études, les essais et les conflits derrière une assertion du graphe.
Exporter des sous-graphes hétérogènes vers PyG et associer des embeddings texte, molécule, protéine ou séquence.
Entraîner des modèles de graphe et tester des liens zero-shot avec API TxGNN, exports PyG et contrôles de fuite split-aware.
Ce qu’il contient
Jouvence-Graph absorbe les couches utiles et naturellement graphes d’Open Targets, puis les étend avec ontologies, interactions, expression, régulation, pharmacologie et données cliniques. Les payloads de métadonnées, à risque de fuite, invalides comme topologie ou non encore acceptés indépendamment restent hors du graphe d’entraînement par défaut. Le code est sous licence MIT ; les licences des sources restent applicables et l’accès cloud requester-pays peut générer des frais d’infrastructure.
Canonique aujourd’hui
Couches Open Targets de variants, génétique, interactions, pharmacogénomique et médicament–cible/maladie ; GO, HPO et UBERON ; interactions protéiques BioGRID ; expression protéique tissulaire HPA ; provenance Cellosaurus tissu/espèce ; texte d’essais ClinicalTrials.gov et métadonnées de liens thérapeutiques.
Revu ou staged
Support TF–enhancer ReMap, hiérarchie et localisation Cell Ontology, Reactome protein-native, cibles ChEMBL protein-native, associations maladie–protéine, essentialité DepMap, réponse GDSC, protéomique de lignées et mappings Cellosaurus supplémentaires.
Pas encore canonique
Régulation directe miRBase/miRTarBase, membres Complex Portal et événements PTM UniProt/BioGRID structurés. Rien n’est présenté comme fini avant validation des endpoints, licences, preuves et risques de fuite.
Les choix d’architecture
SOURCE → ASSERTION → EVIDENCE
Les relations suivent l’assertion et le type d’endpoint réellement portés par la source. Les détails spécifiques restent dans la preuve au lieu de faire exploser la taxonomie du graphe.
COMPATIBILITY
Le namespace txgnn et les classes TxData, TxGNN et TxEval restent les frontières publiques.
REPRODUCIBILITY
Une suite fixture-backed permet d’explorer les concepts sans lire le graphe complet ni dépendre d’une infrastructure privée.
INTEROPERABILITY
Chaque dataset logique est catalogué ; les identifiants de référence et IDs source restent dans les nœuds, preuves ou sidecars de métadonnées.
GUARDED SCALE
Les lectures locales restent bornées. Les scans complets, synchronisations et exports de production sont routés vers l’infrastructure adaptée avec validation et promotion indépendante.
Où aller
Cloner le repo, synchroniser l’environnement avec uv et charger l’API.
Parcourir la suite de notebooks orientée utilisateur.
Pourquoi Open Targets est une fondation, la biologie contraint le graphe et Neo4j reste une vue optionnelle.
Architecture du KG, provenance, exports, embeddings et runbooks.
Séparer les notebooks scientifiques des pipelines de construction.
Commencer par les règles de contexte, de sécurité et de reviewabilité.
Retrouver l’implémentation et la publication TxGNN d’origine.
Agent-ready
Ces prompts imposent les bons points d’entrée et empêchent un agent de lancer un traitement lourd sur votre machine par accident.
Clone https://github.com/jkobject/jouvence-graph.git puis entre dans le repo. Lis AGENTS.md avant toute action. Utilise uv, vérifie Python 3.11+, puis installe l'environnement local avec les groupes dev et notebooks. Exécute uniquement les checks fixture-backed et bornés décrits dans le README. Ne lance aucun scan complet du KG, sync LaminDB bulk, export de production ou entraînement lourd sur cette machine. Termine par un récapitulatif des commandes exécutées, de leurs résultats et des accès optionnels encore nécessaires.
Dans le repo Jouvence-Graph, lis AGENTS.md, README.md et notebooks/README.md. Prépare puis exécute la suite de notebooks publics en mode fixture, sans accès au KG live. Explique-moi ensuite le modèle node / assertion / evidence / feature, montre-moi où commencer pour explorer une maladie ou une molécule, et distingue clairement démonstration locale, accès live borné et traitement de production.
Tu contribues à Jouvence-Graph. Commence par AGENTS.md, puis lis seulement la documentation spécifique à la tâche. Avant de modifier quoi que ce soit, vérifie l'état Git et isole les changements préexistants. Respecte les relations source-native et la séparation assertion/evidence. Utilise uv pour les tests. Toute écriture canonique ou charge lourde exige une autorisation explicite et l'infrastructure prévue. Fournis un diff reviewable, les tests réellement exécutés et les limites de validation restantes.
Prédire en gardant la dérivation