← Back to Home

OpenScience — Self-Host Your Own AI Research Laboratory (Complete Guide)

OpenScience — Self-Host Your Own AI Research Laboratory (Complete Guide)

Scientific research involves a predictable loop: read the literature, formulate a hypothesis, design an experiment, run it, analyze the results, and write it up. Each step is labor-intensive, and running the full loop for a single question can take weeks.

OpenScience, from Synthetic Sciences, an AI research lab based in San Francisco, collapses this loop into a continuous AI-driven workflow. You give it a research goal, and it reads the papers, writes and runs code, executes experiments on real compute, queries scientific databases, and produces a written summary — all on your own machine using your own API keys.

Launched on July 3, 2026, OpenScience has already gathered over 1,500 GitHub stars and is the fastest-growing open-source AI research tool of the month. It supports any frontier or open-weight model from Anthropic, OpenAI, Google, and 75+ other providers, and comes with 290+ built-in skills covering ML training, biology, chemistry, literature review, and LaTeX.

GitHub: synthetic-sciences/OpenScience | Website: openscience.sh | Docs: openscience.sh/docs

Why OpenScience Matters

The gap between asking a research question and getting an answer is enormous. A typical workflow involves:

  1. Searching PubMed and arXiv for relevant papers
  2. Reading and synthesizing findings
  3. Writing code to test a hypothesis
  4. Running experiments (possibly on cloud compute)
  5. Plotting results and drawing conclusions
  6. Writing up the findings in a paper-ready format

Each step requires switching between tools — browsers, terminals, Python notebooks, LaTeX editors, reference managers. OpenScience replaces this fragmented workflow with a single browser workspace that handles the entire loop.

The key insight is that LLMs are good at research planning, but terrible at tool coordination. OpenScience bridges this gap by giving the AI agent a proper toolbelt: a shell, an editor, LSP integration, MCP servers, 30+ scientific database connectors, and a skill system with 290+ pre-built research capabilities.

Architecture Overview

OpenScience Architecture

The system is a local-first architecture running entirely on your machine:

  1. CLI / Launcheropenscience starts a local Hono server and opens a SolidJS workspace in your browser. The first run walks you through key setup (API keys, optional Atlas account).
  2. Agent Runtime — The core message loop with model routing. Each request goes directly to your chosen provider (Anthropic, OpenAI, Google, or 75+ others). No data leaves your machine unless you configure it.
  3. Tool Layer — Four categories of tools: shell (execute commands), editor (modify files), LSP bridge (code intelligence), and MCP client (external tool integration).
  4. Science Connectors — 30+ queryable databases: UniProt, PDB, Ensembl, ChEMBL, PubChem, arXiv, OpenAlex, Semantic Scholar, and more. The agent queries these natively.
  5. Skills Engine — 290+ instruction bundles loaded on demand. Covers ML training (DeepSpeed, PEFT, TRL), evaluation, dataset work, molecular biology, clinical biology, cheminformatics, papers and LaTeX, figures, and cloud compute (Modal, Tinker).
  6. Workspace UI — SolidJS frontend with a file tree, editor, terminal, session history, and inline rendering for molecules, protein structures, genomes, and plots.
  7. Atlas (Optional) — Synthetic Sciences' managed platform for curated frontier models billed from a prepaid wallet. Bring-your-own-key usage is always free.

The server binds to 127.0.0.1 only and enforces a Host/Origin allowlist. There is no remote mode — everything stays local.

Prerequisites

  • Node.js or Bun — Bun 1.3+ is recommended. The CLI is a Bun/TypeScript application compiled to a native binary.
  • An API key — Any provider: Anthropic (ANTHROPIC_API_KEY), OpenAI (OPENAI_API_KEY), Google (GEMINI_API_KEY), or 75+ others
  • 8 GB RAM minimum (16 GB+ recommended for complex research sessions)
  • macOS, Linux, or Windows — Platform binaries are attached to GitHub Releases

Installation

OpenScience installs via npm as a single global package:

npm install -g @synsci/openscience

Then start the workspace:

openscience

The first time you run it, a short setup walks you through model configuration. You can set an API key before starting:

export ANTHROPIC_API_KEY=sk-ant-...
openscience

If you prefer not to install globally, use the one-shot launcher:

npx synsci

This works identically — it installs and runs OpenScience in a single step. Platform binaries are also available on the GitHub Releases page.

To point the workspace at an existing project:

openscience ~/code/my-research-project

Configuration

Global configuration lives at ~/.config/openscience/openscience.json. Project-level configuration goes in openscience.json or a .openscience/ directory at the repo root.

Key configuration options:

  • Provider keys — Set via environment variables (ANTHROPIC_API_KEY, OPENAI_API_KEY, etc.) or through the workspace UI's Credentials panel
  • Model selection — Switch between providers per-request from the model selector in the workspace
  • Custom agents — Define custom agent personas in the project config
  • Plugins — Load MCP servers and custom tools via the plugin system
  • Skills — Install additional skill packs from the Atlas skill index

Using a Local Model

You can use any OpenAI-compatible local endpoint (Ollama, vLLM, LM Studio) by setting the provider URL:

export OPENAI_API_KEY=not-needed
export OPENAI_BASE_URL=http://localhost:11434/v1
openscience

OpenScience routes model requests per-invocation, so you can mix providers freely — use Claude for literature review and a local model for code generation, for example.

Quickstart: Run Your First Research Session

1. Start the Workspace

openscience

This opens http://127.0.0.1:3000 in your browser.

2. Pick a Model

Use the model selector in the workspace header. You can choose any provider key you've configured.

3. Give a Research Goal

In the chat panel, enter something like:

"Compare the binding affinity of approved EGFR inhibitors and suggest which one has the most favorable selectivity profile. Use ChEMBL and PDB."

OpenScience will:

  • Search ChEMBL for binding data on approved EGFR inhibitors
  • Query PDB for available crystal structures
  • Write and run analysis code
  • Generate comparison plots
  • Summarize the findings in a structured report

4. Use Specialized Agents

Switch between agent modes depending on your task:

Agent Mode Use Case
research Default — full research loop
biology Biological data analysis
physics Physics simulations and analysis
ml ML training and evaluation
plan Read-only planning — generate a research plan without executing

Select the agent from the workspace UI or configure it in your project's openscience.json.

Working with Scientific Databases

OpenScience exposes 30+ scientific databases as native tools. The agent queries them automatically when relevant:

  • UniProt — Protein sequence and functional information
  • PDB — Protein Data Bank for 3D structures
  • Ensembl — Genome browser data
  • ChEMBL — Bioactive drug-like molecules
  • PubChem — Chemical compounds and assays
  • arXiv — Preprint server
  • OpenAlex — Scholarly citation data
  • Semantic Scholar — Academic paper search

Example query the agent can handle:

"Find all human kinases with known inhibitors in ChEMBL, retrieve their UniProt entries, and check if any PDB structures exist for the kinase domains."

The agent chains these queries automatically without you writing a single API call.

Skills System

OpenScience ships with 290+ skills organized into domains. Skills are instruction bundles that teach the agent how to perform specific tasks:

  • ML Training — DeepSpeed, PEFT, TRL integration for model fine-tuning
  • Evaluation — Standard ML evaluation benchmarks
  • Dataset Work — Data loading, preprocessing, and augmentation
  • Molecular Biology — Sequence analysis, BLAST, alignment tools
  • Clinical Biology — Clinical trial data analysis
  • Cheminformatics — Molecule manipulation, SMILES parsing, docking
  • Papers & LaTeX — Paper writing, reference management, BibTeX
  • Figures — Publication-quality plotting and visualization
  • Cloud Compute — Modal and Tinker integration for remote execution

Users can install additional skill packs and create custom skills using the TypeScript SDK.

Verification Checklist

After following the setup steps, verify everything works:

  • openscience starts the workspace at http://127.0.0.1:3000
  • The browser workspace loads with the chat panel visible
  • Model selector shows your configured provider
  • Setting a research goal produces a plan, not an error
  • Scientific database queries return results (e.g., "Search ChEMBL for aspirin")
  • Code execution works (the agent can write and run Python/Shell commands)
  • Switching between agents changes the agent's behavior
  • Session history persists across restarts

Comparison: OpenScience vs. Alternatives

Feature OpenScience Claude Science ChatGPT Research
License Apache 2.0 (open-source) Proprietary Proprietary
Self-hosted ✅ Yes ❌ No ❌ No
Local models ✅ Any OpenAI-compatible endpoint ❌ No ❌ No
Data privacy ✅ Everything runs locally ❌ Data sent to Anthropic ❌ Data sent to OpenAI
Research agents 5 specialized agents + custom 1 default agent 1 default agent
Scientific DBs 30+ native connectors Limited Limited
Skills 290+ built-in, extensible No No
Plugin system ✅ MCP + TypeScript SDK
Cloud compute ✅ Modal, Tinker
Cost Free (BYO API keys) Subscription Subscription

Resources

← Retour à l'Accueil

OpenScience — Auto-hébergez Votre Propre Laboratoire de Recherche IA (Guide Complet)

OpenScience — Auto-hébergez Votre Propre Laboratoire de Recherche IA (Guide Complet)

La recherche scientifique suit une boucle prévisible : lire la littérature, formuler une hypothèse, concevoir une expérience, l'exécuter, analyser les résultats, et rédiger les conclusions. Chaque étape est laborieuse, et parcourir la boucle complète pour une seule question peut prendre des semaines.

OpenScience, de Synthetic Sciences, un laboratoire de recherche IA basé à San Francisco, condense cette boucle en un flux de travail continu piloté par l'IA. Vous lui donnez un objectif de recherche, et il lit les articles, écrit et exécute du code, réalise des expériences sur du vrai calcul, interroge des bases de données scientifiques, et produit un résumé écrit — le tout sur votre machine en utilisant vos propres clés API.

Lancé le 3 juillet 2026, OpenScience a déjà rassemblé plus de 1 500 étoiles GitHub et est l'outil de recherche IA open-source qui connaît la croissance la plus rapide du mois. Il supporte n'importe quel modèle frontal ou open-weight d'Anthropic, OpenAI, Google et plus de 75 autres fournisseurs, et est livré avec plus de 290 compétences intégrées couvrant l'entraînement ML, la biologie, la chimie, la revue de littérature et LaTeX.

GitHub : synthetic-sciences/OpenScience | Site web : openscience.sh | Documentation : openscience.sh/docs

Pourquoi OpenScience est Important

Le fossé entre poser une question de recherche et obtenir une réponse est énorme. Un flux de travail typique implique :

  1. Rechercher sur PubMed et arXiv les articles pertinents
  2. Lire et synthétiser les résultats
  3. Écrire du code pour tester une hypothèse
  4. Exécuter des expériences (éventuellement sur le cloud)
  5. Tracer les résultats et tirer des conclusions
  6. Rédiger les résultats dans un format publiable

Chaque étape nécessite de changer d'outils — navigateurs, terminaux, notebooks Python, éditeurs LaTeX, gestionnaires de références. OpenScience remplace ce flux de travail fragmenté par un seul espace de travail navigable qui gère toute la boucle.

L'idée clé est que les LLM sont bons pour la planification de recherche, mais terribles pour la coordination d'outils. OpenScience comble ce fossé en donnant à l'agent IA une véritable boîte à outils : un shell, un éditeur, une intégration LSP, des serveurs MCP, plus de 30 connecteurs de bases de données scientifiques, et un système de compétences avec plus de 290 capacités de recherche pré-construites.

Architecture

Architecture OpenScience

Le système est une architecture locale fonctionnant entièrement sur votre machine :

  1. CLI / Lanceuropenscience démarre un serveur Hono local et ouvre un espace de travail SolidJS dans votre navigateur. Le premier lancement vous guide dans la configuration des clés API et du compte Atlas optionnel.
  2. Moteur d'Agent — La boucle de messages centrale avec routage de modèles. Chaque requête va directement à votre fournisseur choisi (Anthropic, OpenAI, Google, ou 75+ autres). Aucune donnée ne quitte votre machine sauf si vous le configurez.
  3. Couche d'Outils — Quatre catégories : shell (exécuter des commandes), éditeur (modifier des fichiers), pont LSP (intelligence de code), et client MCP (intégration d'outils externes).
  4. Connecteurs Scientifiques — 30+ bases de données interrogeables : UniProt, PDB, Ensembl, ChEMBL, PubChem, arXiv, OpenAlex, Semantic Scholar, et plus encore.
  5. Moteur de Compétences — 290+ bundles d'instructions chargés à la demande. Couvre l'entraînement ML (DeepSpeed, PEFT, TRL), l'évaluation, les données, la biologie moléculaire, la biologie clinique, la chémoinformatique, les articles et LaTeX, les figures, et le calcul cloud (Modal, Tinker).
  6. Interface Workspace — Frontend SolidJS avec arborescence de fichiers, éditeur, terminal, historique des sessions, et rendu inline pour molécules, structures de protéines, génomes et graphiques.
  7. Atlas (Optionnel) — La plateforme gérée de Synthetic Sciences pour des modèles frontaux curated, facturés depuis un portefeuille prépayé. L'utilisation avec vos propres clés est toujours gratuite.

Le serveur se lie uniquement à 127.0.0.1 et applique une liste blanche Host/Origin. Il n'y a pas de mode à distance — tout reste local.

Prérequis

  • Node.js ou Bun — Bun 1.3+ est recommandé. Le CLI est une application Bun/TypeScript compilée en binaire natif.
  • Une clé API — N'importe quel fournisseur : Anthropic (ANTHROPIC_API_KEY), OpenAI (OPENAI_API_KEY), Google (GEMINI_API_KEY), ou 75+ autres
  • 8 Go de RAM minimum (16 Go+ recommandé pour les sessions de recherche complexes)
  • macOS, Linux ou Windows — Les binaires sont attachés aux GitHub Releases

Installation

OpenScience s'installe via npm comme un seul paquet global :

npm install -g @synsci/openscience

Puis démarrez l'espace de travail :

openscience

La première fois que vous l'exécutez, un court assistant vous guide dans la configuration du modèle. Vous pouvez définir une clé API avant de démarrer :

export ANTHROPIC_API_KEY=sk-ant...
openscience

Si vous préférez ne pas installer globalement, utilisez le lanceur one-shot :

npx synsci

Cela fonctionne de manière identique — il installe et exécute OpenScience en une seule étape. Les binaires sont également disponibles sur la page GitHub Releases.

Pour pointer l'espace de travail vers un projet existant :

openscience ~/code/mon-projet-recherche

Configuration

La configuration globale se trouve dans ~/.config/openscience/openscience.json. La configuration au niveau du projet va dans openscience.json ou un répertoire .openscience/ à la racine du dépôt.

Options de configuration clés :

  • Clés fournisseur — Définies via des variables d'environnement (ANTHROPIC_API_KEY, OPENAI_API_KEY, etc.) ou via le panneau Credentials de l'interface workspace
  • Sélection de modèle — Changez de fournisseur par requête depuis le sélecteur de modèle
  • Agents personnalisés — Définissez des personas d'agents dans la configuration du projet
  • Plugins — Chargez des serveurs MCP et des outils personnalisés via le système de plugins
  • Compétences — Installez des packs de compétences supplémentaires depuis l'index Atlas

Utiliser un Modèle Local

Vous pouvez utiliser n'importe quel endpoint local compatible OpenAI (Ollama, vLLM, LM Studio) en définissant l'URL du fournisseur :

export OPENAI_API_KEY=not-ne...
export OPENAI_BASE_URL=http://localhost:11434/v1
openscience

OpenScience route les requêtes de modèle par invocation, vous pouvez donc mélanger librement les fournisseurs — utilisez Claude pour la revue de littérature et un modèle local pour la génération de code.

Démarrage Rapide

1. Démarrez l'Espace de Travail

openscience

Cela ouvre http://127.0.0.1:3000 dans votre navigateur.

2. Choisissez un Modèle

Utilisez le sélecteur de modèle dans l'en-tête de l'espace de travail.

3. Donnez un Objectif de Recherche

Dans le panneau de chat, entrez quelque chose comme :

"Comparez l'affinité de liaison des inhibiteurs d'EGFR approuvés et suggérez lequel a le profil de sélectivité le plus favorable. Utilisez ChEMBL et PDB."

OpenScience va :

  • Chercher dans ChEMBL les données de liaison des inhibiteurs d'EGFR approuvés
  • Interroger PDB pour les structures cristallines disponibles
  • Écrire et exécuter du code d'analyse
  • Générer des graphiques de comparaison
  • Résumer les résultats dans un rapport structuré

4. Utilisez des Agents Spécialisés

Changez de mode d'agent selon votre tâche :

Mode Agent Cas d'Usage
research Par défaut — boucle de recherche complète
biology Analyse de données biologiques
physics Simulations et analyse physiques
ml Entraînement et évaluation ML
plan Planification en lecture seule — générer un plan sans exécuter

Sélectionnez l'agent depuis l'interface workspace ou configurez-le dans openscience.json.

Travailler avec les Bases de Données Scientifiques

OpenScience expose plus de 30 bases de données scientifiques comme outils natifs. L'agent les interroge automatiquement quand c'est pertinent :

  • UniProt — Informations sur les séquences et fonctions des protéines
  • PDB — Protein Data Bank pour les structures 3D
  • Ensembl — Données du génome
  • ChEMBL — Molécules bioactives de type médicamenteux
  • PubChem — Composés chimiques et tests
  • arXiv — Serveur de prépublications
  • OpenAlex — Données de citations académiques
  • Semantic Scholar — Recherche d'articles académiques

Exemple de requête que l'agent peut gérer :

"Trouvez toutes les kinases humaines avec des inhibiteurs connus dans ChEMBL, récupérez leurs entrées UniProt, et vérifiez si des structures PDB existent pour les domaines kinase."

L'agent enchaîne ces requêtes automatiquement sans que vous écriviez un seul appel API.

Système de Compétences

OpenScience est livré avec plus de 290 compétences organisées par domaine. Les compétences sont des bundles d'instructions qui apprennent à l'agent comment effectuer des tâches spécifiques :

  • Entraînement ML — Intégration DeepSpeed, PEFT, TRL pour le fine-tuning
  • Évaluation — Benchmarks d'évaluation ML standards
  • Données — Chargement, prétraitement et augmentation de données
  • Biologie Moléculaire — Analyse de séquences, BLAST, outils d'alignement
  • Biologie Clinique — Analyse de données d'essais cliniques
  • Chémoinformatique — Manipulation de molécules, parsing SMILES, docking
  • Articles et LaTeX — Rédaction d'articles, gestion de références, BibTeX
  • Figures — Traçage et visualisation de qualité publication
  • Calcul Cloud — Intégration Modal et Tinker pour exécution à distance

Les utilisateurs peuvent installer des packs de compétences supplémentaires et créer des compétences personnalisées avec le SDK TypeScript.

Liste de Vérification

Après avoir suivi les étapes d'installation, vérifiez que tout fonctionne :

  • openscience démarre l'espace de travail à http://127.0.0.1:3000
  • L'espace de travail navigateur se charge avec le panneau de chat visible
  • Le sélecteur de modèle montre votre fournisseur configuré
  • Donner un objectif de recherche produit un plan, pas une erreur
  • Les requêtes aux bases de données scientifiques retournent des résultats
  • L'exécution de code fonctionne (l'agent peut écrire et exécuter des commandes Python/Shell)
  • Changer d'agent modifie le comportement de l'agent
  • L'historique des sessions persiste entre les redémarrages

Comparaison : OpenScience vs. Alternatives

Fonctionnalité OpenScience Claude Science ChatGPT Recherche
Licence Apache 2.0 (open-source) Propriétaire Propriétaire
Auto-hébergé ✅ Oui ❌ Non ❌ Non
Modèles locaux ✅ Tout endpoint compatible OpenAI ❌ Non ❌ Non
Confidentialité ✅ Tout tourne en local ❌ Données envoyées à Anthropic ❌ Données envoyées à OpenAI
Agents recherche 5 agents spécialisés + personnalisés 1 agent par défaut 1 agent par défaut
BDD scientifiques 30+ connecteurs natifs Limité Limité
Compétences 290+ intégrées, extensibles Non Non
Système de plugins ✅ MCP + SDK TypeScript
Calcul cloud ✅ Modal, Tinker
Coût Gratuit (vos clés API) Abonnement Abonnement

Ressources