Source-linked AI summary
PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data
Zhenchao Tang, Xiaogang Xu, Tianxu Lv, Jiahui Guan, Jiale Zhou, Haohuai He, Zhi Song, Hanbo Huang, Jiehui Huang, Jiafei Wu, Zhe Liu
TL;DR
生物学的推論モデルには、コストの高い専門家作成の軌跡を超える、スケーラブルな教師信号が必要である。PertMindは実験測定されたperturbation responseをreinforcement signalとして利用し、forward predictionから多様な生物学的タスクおよびrepresentationへ転移する。
問題
専門家作成の生物学的推論軌跡は、perturbation atlasにおけるdrug–gene–contextの組合せ全体へ拡張するにはコストが高く、スケールさせることが難しい。
手法
PertMindは、trusted-trajectory initializationと、実験測定されたperturbation responseから導出したgene・pathway・formatレベルのrewardを用いて、language-model policyを学習する。
結果
PertMindは未知のcontextにおけるresponse predictionを強化し、task-specific adaptationなしに、reverse inference、double perturbation、screening、process interpretation、およびmultiscale representationへ転移した。
要点と限界
実験的endpointは、ranking、process name、mechanistic brief、continuous representationを必要とする生物学的操作全体で、pretrained modelから再利用可能な生物学的戦略を選び出せる。
要点と限界
これらのrewardは、自由記述の推論を因果的に検証せず、protein activity、metabolic flux、spatial signaling、causal pathway activationも直接測定しない。
Abstract
from arXiv · showhide
Large language models can describe mechanisms, yet scalable post-training still depends on costly, manually curated biological reasoning traces. Here we show that cellular perturbation atlases can instead become reinforcement-learning environments, where measured gene responses provide computable rewards for biological reasoning. We introduce PertMind, which combines trusted-trajectory supervised initialization with gene-, pathway-, and format-level reinforcement signals. Trained only on forward perturbation-response prediction, PertMind improved response inference in unseen cellular contexts while retaining general language capabilities. It also transferred without task-specific post-training to reverse perturbation identification, double-perturbation reasoning, phenotypic-screen prioritization, and biological-process interpretation. PertMind further generated biological profiles that supported competitive gene, cell, and donor representations across multiscale downstream tasks. These results support the hypothesis that reinforcement on experimental endpoints can concentrate reusable biological strategies already accessible to pretrained models. More broadly, perturbation-derived reinforcement learning offers a scalable route for transforming expanding experimental atlases into training environments for general-purpose biological reasoning.
1 はじめに
PertMindは、細胞摂動アトラスをスケーラブルな強化学習環境として再構成し、測定された遺伝子応答を用いてLLMの生物学的推論を学習する。得られたモデルは、順方向の応答予測を超えて、逆方向推論、二重摂動推論、表現型スクリーニングの優先順位付けへ転移する。
- 動機: PertMindは、公開細胞摂動アトラスで測定された介入をLLMの強化学習経験へ変換することで、教師信号のボトルネックに対処する。このフレームワークは、手作業でキュレーションされた生物学的推論トレースだけに依存せず、実験エンドポイントを計算可能な報酬として利用する。
- 手法: この手法は、信頼できるモデル生成軌跡、アトラス由来の差次的発現ラベル、強化学習を組み合わせ、構造化されたエビデンス基盤の生物学的推論を確立する。Qwen3-4B Baseを出発点とし、約100-million-profileの摂動atlasであるTahoe-100Mからgene中心のクエリを構築する。
- 結果: PertMindは順方向の標的遺伝子目的を超えて転移し、逆方向の摂動条件推論ではタスク特化モデルに迫り、二重摂動による学習なしに二重摂動クエリへ拡張する。これらのタスク横断的な結果は、強化学習が学習目的の最適化だけでなく、再利用可能な生物学的方略を獲得したかを検証する。
- 結果: PertMindが生成したbiology briefはAssayBenchにおける表現型スクリーニングのヒット優先順位付けを改善し、タスク横断的な証拠全体は、摂動エンドポイントから学習された再利用可能な生物学的推論方略を支持する。報告された範囲には、推論に基づく摂動応用と、再利用可能な分子・細胞・ドナー表現も含まれる。
2 方法
PertMindは、細胞株–薬剤–遺伝子クエリに対する細胞摂動応答予測を、監査可能で知識に基づく推論として定式化し、実験から導出した遺伝子応答ラベルとpathway supervisionを用いる。その学習では、trusted-trajectory initializationとgene・pathway・formatレベルの強化信号を組み合わせつつ、遺伝子ラベルの正確性を主要目的として維持する。
- タスク定式化: PertMindは、細胞株–摂動–遺伝子の三つ組から、標的遺伝子のUp、Down、またはNo responseを予測し、検索した根拠に基づく監査可能な機構的根拠を生成する。三値ラベルは、多段階の制御応答の符号に対するスケーラブルな学習インターフェースであり、自然言語のtrajectoryは最終的な遺伝子レベルの結論を説明する。
- データとラベル: ラベルはTahoe-100Mのpseudobulk differential-expression統計から得られ、曖昧な記録を除外したうえで細胞株を互いに重複しないよう分割し、五つのheld-out linesを評価に用いる。UpとDownにはpadj ≤ 0.05および±0.585のlog2 fold-change閾値を課す一方、Noには弱い効果、高いpadj、十分な発現を要求する。Noは厳密なnullであるとの主張ではない。
- 初期化: PertMindはまず、検索した生物学的コンテキストと均衡化された重み付けを用いてtrusted-trajectory SFTを1 epoch実施し、GRPOの前に構造化された機構指向の推論を初期化する。trajectoryには、正しいラベル、所定のformat、隠れたラベルに関する主張がないこと、裏付けられたentityが必要である。得られたpolicyはGRPOを初期化し、その固定KL referenceとして機能する。
- 強化報酬: 中核となる強化手法は、gene-level outcome rewardと、outcome-independentな転写proxyから導出したpathway-level checkpoint rewardを組み合わせる。候補Reactome pathwayは特定の発現outcomeを調べずに選択し、pathway evidenceは一致するdose-and-plate条件間で保守的に集約する。
- 報酬制約: 補助的なpathway rewardとformat rewardは部分点を与えるが、gene labelが誤った応答が正しい応答を上回ることは許さない。正の補助重みはλpw + λfmt < 1を満たし、分散がゼロの群は勾配に寄与せず、支持の弱い三つ組には一様にスケールした更新を適用する。
3 データセットと実験設定
PertMindは、Tahoe-100Mのforward perturbation supervisionを用い、training recordをvalidationおよびheld-out contextから厳密に分離したcell-line-held-out protocolの下で訓練・評価される。実験群は、forward response prediction、reverse intervention identification、cross-task biological reasoning、multiscale representation qualityを対象とする。
- Training setup: PertMindはQwen3-4B Baseから初期化し、検証済みのtrusted trajectoryを用いて、BFT-weighted SFTに続くGRPOで訓練する。Trusted-trajectory constructionではqueryごとにM = 8個のcandidateをsampleする。SFTは1 epoch、GRPOは3 epochs実行し、両stageでLoRA rank 64を用いる。
- Ablations: アブレーションprotocolでは、同一のheld-out-cell protocolの下で、Base、BFT-weighted SFT、shuffled-pathway control、gene-only GRPO、prompt-only pathway context、full PertMindを比較する。Shuffled controlでは、pathway frequencyとprompt structureを保持しつつ、training partition内でpathway labelをpermutationする。
- Forward perturbation response: Forward evaluationでは、held-out Tahoe-100M tripletに対してVCWorld/GeneTAKを用い、differential-expression detectionとregulation-direction predictionを行い、複数のbaselineに対するAccuracyとMacro-F1を報告する。Differential-expression detectionはtarget geneが変化するかを予測し、direction predictionは変化したgeneについてupregulationとdownregulationを識別する。
- Generalization and representation evaluation: 追加評価では、reverse perturbation ranking、phenotypic-screen gene prioritization、ならびにgene-, cell-, and donor-level representationsを、task-specific accuracy、F1、ranking、AUC、decoding、error metricsで検証する。Reverse predictionでは、Schmidt et al. (2022)のhuman T-cell datasetにおける69個のcandidate interventionをrankingする。AssayBenchでは、334 screensからなるofficial year-fold0 test splitとAnDCG@100を用いる。Representation testはmolecular、cellular、donorの各scaleにまたがる。
4 結果
PertMindは、未知の細胞株における摂動応答ベンチマークでGeminiベースの参照モデルと同等以上の性能を示し、一般的な言語能力も概ね維持した。タスク固有の追加学習なしに、逆向きおよび組合せ摂動推論、表現型スクリーニングの優先順位付け、生物学的過程の解釈、ならびに競争力のある分子・細胞表現へ転移した。
- 順向き摂動応答予測: PertMindは、未知の細胞株におけるDEおよびDIRタスクと各評価指標でGeminiベースのVCWorld参照モデルと同等以上の性能を示し、ホールドアウト条件の大半でこれを上回った。この評価では、オープンソースのVCWorld摂動応答ベンチマークを用い、Gemini-2.5-Flashで構成したVCWorldハーネスとPertMindを比較した。
- 学習アブレーション: Pathway-supervised reinforcement learningは、SFTおよびgene-only reinforcementを上回る最大のvariant性能向上をもたらした一方、対応するrewardを伴わないpathway contextでは性能は向上しなかった。アブレーションでは、タスク–指標の組合せとホールドアウト細胞株にわたり、6種類の学習variantを比較した。
- 一般能力の保持: PertMindはzero-shotおよびfew-shotのMMLUとCMMLUでBaseおよびSFTモデルに近い性能を維持し、精度は一貫して小幅に低下したものの、観測された壊滅的忘却はなかった。報告された保持性能には、BFTやpolicy driftを制限する制約などの設計選択が関与した。
- 逆向き・組合せ推論への転移: 順向きのみの追加学習にもかかわらず、PertMindは逆向きタスクのTop-1、Top-5、F1性能で専門モデルCellNaviに迫り、BaseおよびSFTを大幅に上回り、摂動シフト全体でより頑健であった。CellNaviは平均性能では優れていたが、一部の標的では精度が急落したのに対し、PertMindは順序付けた摂動と発現シフト方向にわたり、より平坦なプロファイルを維持した。
- 表現型スクリーニングの優先順位付け: PertMind briefは、5つすべての表現型クラスと3種類のranking backboneで表現型スクリーニングの順位付けを改善し、matched briefは最良のAnDCG@100、最多のtop-100 hits、最低のhallucination rateを達成した。全スクリーニング評価では334件のtest screensを用い、層別解析では36件のscreensを対象とした。
- 生物学的解釈と表現: PertMindは、生物学的過程に関するlexicalおよびsemantic agreementを改善し、parameter updateなしにfrontier modelへ転移可能なcontextを提供するとともに、競争力のある分子・細胞表現を生成した。そのembeddingはGeneformerの分子タスクで強力な参照モデルと競合し、STATEベースの摂動予測ではscProtoTransformerに迫り、標準的なSTATE-SMを全体として上回った。
5 考察
PertMindは、実験的に測定されたperturbation endpointによって、forward-response predictionを超えて汎化しつつ、pretrained capabilityを概ね保持する再利用可能なbiological language-model policyを学習できることを示す。結果は、生物学的整合性をもつstrategyの選択と集中を支持する一方、mechanistic faithfulnessに関する主張には限界がある。
- 中核的知見: PertMindは、未知のcellular contextにおけるresponse predictionを強化し、pretrained capability全般を保持するとともに、task direction、perturbation composition、functional interpretation、representation scaleをまたいで転移した。これらの知見は、実験的に測定されたperturbation endpointが、forward-response classifierにとどまらず、再利用可能なbiological language-model policyのtraining signalとなることを支持する。
- 学習の解釈: gene-level rewardは測定されたresponseに到達するtrajectoryを選択し、pathway rewardは、最終的なgene decisionに先立って協調的なtranscriptional consistencyを促す中間的ガイダンスを与えた。shuffled-label controlは、改善が単にrewardの密度やoutput structureによるものではなく、生物学的整合性に依存することを示した。
- 学習の解釈: 正しい結論はすでにBase modelのsampling supportに現れていたが、reinforcement learningは、有用で利用可能なstrategyへ確率を再配分することで、それらを信頼できるdecisionへ集中させた。Pre-RL best@Nは、modelがすでに正しい結論をsamplingしていたことを示す補完的証拠となった一方、greedy decodingとmajority votingはそれらを安定して集中させなかった。
- タスク間転移: PertMindは、reverse-task adaptationなしに、reverse perturbation-condition predictionおよび未知のdouble-perturbation reasoningへ転移し、primary-cell perturbationではspecialized transition modelに近づいた(Schmidt et al., 2022; Wang et al., 2025a)。post-training objectiveを超えたこの転移は、選択されたstrategyが再利用可能であることの証拠として提示される。
- Representation: PertMindが生成したgene profileは、分散したmodel knowledgeをnatural-language representationとして外在化し、molecular annotationを支えるとともに、GenePTの前提を拡張した(Chen & Zou, 2025)。これらのprofileは一度encodeした後、異なるbiological taskに適応できる。
- 限界: Terminal rewardはendpoint-prediction shortcutを許す可能性があり、free-text trajectoryは監査可能である一方、因果的には検証されていない。trusted-trajectory filterによっても、基礎にある計算のfaithful reportingは確立できない。これらの限界により、生成されたexplanationをmechanistic accountとして解釈することには制約がある。
A 追加手法詳細
この付録では、本文の表記法、記号、ラベルを維持しつつ、Section 2から割愛された再現性の詳細を示す。
- 付録では、Section 2から割愛された再現性の詳細をまとめる。
- 付録の表記法は本文に従う。
- また、付録では本文の記号とラベルも維持する。
A.1 データ構築の詳細
データセット構築パイプラインでは、条件レベルの差次的発現レコードを定義し、信頼性の低い比較を除外したうえで、遺伝子中心ラベル用に適格な測定値を薬剤単位で統合する。経路報酬用には条件レベルのレコードを別途保持し、信頼度重み付けを適用するとともに、リークを防ぎながら細胞株単位でデータを分割する。
- 完全な実験条件と薬剤レベルの統合: 条件レベルのレコードでは、欠測効果または欠測調整済み有意性のレコードを除外した後、DESeq2-style statistics、実験識別子、処理群/対照群の細胞数を保持する。保持される統計量には、baseMean、log2FoldChange、lfcSE、stat、pvalue、padjが含まれる。
- 完全な実験条件と薬剤レベルの統合: 遺伝子中心ラベルでは、同一薬剤を共有する残存条件を、絶対log2 fold changeが最大のレコードを残すことで統合する。一方、報酬側テーブルでは、経路計算のため個々の条件を保持する。これにより、主要ラベルの割り当てと信頼度重み付けを、条件固有の経路応答proxyの計算から分離する。
- 信頼度重み付け: 信頼度重みは0.1から1の範囲で、ラベルを変更せずに、強い有意な方向性判定および高発現で効果がほぼゼロのnull判定に対する実効的な教師信号を増加させる。重みは、効果量、調整済み有意性、発現統計量から計算される。
- 分割、クラス層化、リーク: サンプルは細胞株単位で、ホールドアウトテストドメインと開発ドメインに分割し、開発グループはさらに90:10で層化した訓練パーティションと検証パーティションに分ける。適格性およびラベル規則は、両ドメイン内で開発分割に先立って適用する。
- 分割、クラス層化、リーク: Retrievalでは、反復測定、検証結果、ホールドアウト細胞の結果を除外し、バッチとprompt streamは、上限設定やdownsamplingなしで、細胞株、薬剤、ラベルによって層化する。各候補例は、集約されたpseudobulk統計量から得られる、適格な細胞株–perturbation–遺伝子レコードである。
A.2 TRAJECTORYとSFTの詳細
trajectory pipelineは、結果に依存しない生物学的コンテキストを取得し、base Qwen3-4B policyから8つのreasoning trajectoryをサンプリングし、confidence-balanced weightingを用いて信頼できる応答で学習する。query expression measurementsとlabelsはretrieval promptから引き続き隠され、低confidenceのspanにはより強い学習上の重みが与えられるが、weightの操作は許容しない。
- Retrieval configuration: Retrievalではbiomedical resource間でentityを対応付け、頻出する低情報量nodeと重複factを除去し、Ctrainに限定した結果に依存しない情報を用いてdrug、gene、cell-contextのsimilarityを計算する。cell-context similarityにはtissue、lineage、curated genotype annotationを用い、drugとgeneのsimilarityはsemantic annotationとknowledge-graph topologyを組み合わせる。
- Retrieval configuration: promptからcurrent-queryのexpression measurementsとlabelsを除外するため、推論ではknowledge-graph evidenceと、historical outcomesを伴うoutcome-stratified training caseのみを用いる。Figure 7は、modelから見えるfield、要求されるresponse order、promptから隠されたreward quantityを要約する。
- Balanced Fine-Tuning objective: Balanced Fine-Tuningではlocal confidenceとsequence-level difficulty weightを用い、孤立した低confidence tokenの重みを下げる一方、difficult local spansを含むtrajectoryを重視する。Stop-gradientにより、modelがresponse-token likelihoodを高める代わりにconfidence-derived weightを操作することを防ぐ。
A.3 PATHWAY SUPERVISION DETAILS
Pathway supervisionでは、outcomeに依存しないReactome候補選定と、target geneを除外したcondition-levelの転写応答proxyを用いる。保守的なconsensus labeling、不確実性への対処、maskingにより、leakageを防ぎ、互換性のない実験条件の融合を避ける。
- Candidate pathway selection: Reactome候補は10–200 membersに限定し、scoringからtarget geneを除外したうえで、outcome前のgene-membership情報とdrug-relevance情報を用いて順位付けする。Drug relevanceでは、direct target、信頼度の高いone-またはtwo-hop network link、curated mechanism-of-action axisを優先し、αgene = 0.60、αdrug = 0.40とする。利用できないannotationはunknownのままとする。
- Condition-level pathway-response proxy: Pathway-response proxyは、protein activity、metabolic flux、causal activationを直接測定するのではなく、各single dose-and-plate condition内におけるnon-targetの協調的な転写効果を要約する。信頼できるmemberが5未満のcondition、またはgray-zone effectを示すconditionはuncertainとする。thresholdにはγ = 0.60、τdir = 0.20、τno = 0.05、ηno = 0.20を用いる。
- Cross-condition consensus for drug-level pathway labels: Drug-level pathway labelは、すべてのdeterminate conditionがUp、Down、またはNoで一致する場合にのみ付与する。不一致、またはdeterminate conditionが存在しない場合はuncertainとする。Uncertainなcondition labelは無視し、単一のdeterminate conditionからdrug-level labelを付与できる。doseやplateをまたいで測定値を統合することはない。
- Model-visible information and pathway masking: Promptには、固定されたoutcome非依存のrepresentative memberを含む、保持された候補集合全体を提示する。一方、uncertainな候補はpathway rewardからmaskするが、main-task trainingからそのtripletを削除することはない。これによりtraining corpusを保持し、expression leakageなしにpathway augmentationによってsupervision densityを高められる。
A.4 完全な最適化の定義
PertMindの完全な最適化では、group内で信頼度重み付けしたGRPOに、clipped policy updateと凍結SFT referenceへのKL正則化を組み合わせる。標準化によりgroup内の順位を保持し、correctness、formatting、class balance、length、policy divergenceをモニタリングしてreward hackingを検出する。
- Group標準化と信頼度スケーリング: 分散がゼロのgroupでは勾配への寄与が消失する一方、primary rewardが一様な場合にはauxiliary rewardが選好シグナルを保持する。信頼度はgroup標準化の後に、完全なsample objectiveに対する正のper-triplet multiplierとして適用され、group内の順位を保持する。
- ClippedかつKL正則化されたpolicy最適化: このobjectiveでは、clipped importance ratioに用いる更新後のbehavior policyと、KL正則化に用いる凍結SFT referenceを区別する。confidence weightは、clipされたsurrogateとKLペナルティの両方を含む応答ごとの完全な目的関数全体を、正確に一度だけスケーリングする。
- ClippedかつKL正則化されたpolicy最適化: Token-level KL正則化は非負であり、現行確率とSFT-reference確率が一致すると消失し、vocabularyを列挙せずsampled tokenのみを用いる。Clipping項はrewardに駆動されるupdateの大きさを制限し、πθSFTへのKLはSFT中に確立された言語能力と推論構造を保持する。
- Trainingモニタリング: Trainingでは、gene accuracy、per-class recall、pathway accuracy、format pass rate、response length、policy KLをモニタリングし、reward hackingを特定してearly stoppingまたはhyperparameter調整の指針とする。モニタリング対象のfailure modeには、formatのみの最適化、majority classの過剰予測、correctnessではなくresponse lengthによる間接的なadvantageが含まれる。
A.5 クロススケール埋め込み構築
PertMindは、遺伝子プロファイルを生成し、そのテキスト埋め込みを下流タスク向けに適応させ、発現量で重み付けした細胞埋め込みとattentionベースのドナー埋め込みへ集約することで、階層的な生物学的表現を構築する。タスク固有のadapterは各学習fold内で再初期化し、参照学習データのみで最適化する。
- 遺伝子表現: PertMindは、各遺伝子について、その機能、相互作用、pathway、文脈依存的な役割を記述するプロファイルを生成し、テキスト埋め込みを数値表現として用いる。このアプローチは、生成テキストを生物学的知識と数値表現の間のinterfaceとして扱うGenePTに従う。
- 遺伝子表現: タスク固有の学習可能なprojectionにより、共通の遺伝子表現を下流decoderに適応させる。この際、共有された固定次元の潜在空間を仮定しない。各adapterはすべての学習fold内で再初期化し、参照学習partitionのみを用いて、下流classifierまたはdecoderと共同で最適化する。
- 細胞表現: 細胞埋め込みは、非負に前処理した発現量重みと行方向の単位ℓ2正規化を用いて、表現された遺伝子プロファイルを組み合わせる。正のϵにより、発現量で重み付けした集約時のゼロ除算を防ぐ。
- ドナー表現: ドナー埋め込みは、attention moduleを用いて構成細胞をmulti-instance bagとして集約し、ドナー単位の分類に用いる表現を生成する。この構築により、遺伝子から細胞、細胞からドナーへ至る階層が形成される。
B 追加結果
追加解析から、Base modelは正しいforward perturbationの回答をサンプリングできるものの、それらを確実に選択できず、生物学的判断の誤りが、パースではなく、依然として主なボトルネックであることが示される。PertMindはbiotypeに富むgene embedding構造も保持しており、補足評価ではsubject-level能力と文献監査済みの事例を検討する。
- Pre-RLサンプリング解析: Oracle best@Nはreinforcement learning前に急上昇し、その後の利得は縮小するもののゼロにはならず、deployableな推論時選択機構なしに正解を支える潜在能力があることを示す。oracleはgold labelを用いる評価専用の診断であり、inference時にmodelが実装することはできない。
- Pre-RLサンプリング解析: Parse rateは飽和に近い状態を維持するため、forward perturbationの失敗の大半は、終端labelの欠落ではなく、生物学的判断の誤りを反映する。平均parse rateは1に近い状態を保ち、any-parse rateはrollout全体で実質的に飽和している。
- Pre-RLサンプリング解析: クラス条件付きサンプリングには偏りがあり、Upが最も容易で、Downはより緩やかに改善し、Noはrollout数全体で最も難しいままである。Noを正しく同定することはdifferential-expression detectionで特に難しく、Up–Down間の差は、方向予測に真の識別能力が必要であることを示す。
- Gene-embedding可視化: PertMindのgenome-wide UMAPは、biotypeに富むgene領域を明瞭に保持しており、reference-mapping結果を補完する定性的な分子組織化を与える。UMAPの幾何は前処理と可視化hyperparameterに依存するため、定量的なperformance metricではない。
- 追加評価: 補足評価には、0-shotおよび5-shot設定でのBase、SFT、PertMindに対するsubject別MMLU and CMMLU accuracyに加え、文献監査済みのVemurafenib–C32–MKI67事例が含まれる。強調した事例の主張を裏付ける文献は、生成された推論過程がfaithfulであったことを立証するものではない。