注目★★★★★Hugging Face Papers
BioMatrix:配列・構造・言語を単一アーキテクチャで統合した生物基盤モデル
30秒で把握
- 1BioMatrixが分子・蛋白質の配列・構造・言語を単一デコーダで統合し公開
- 2Qwen3ベース1.7B/4B、3,044億トークンで事前学習しアダプタ不要で全モダリティ生成
- 3創薬・蛋白質設計チームは既存生物基盤モデルとの性能比較検証を行うとよい
要約
BioMatrixは、分子と蛋白質の配列・3D構造・自然言語を単一のデコーダー専用アーキテクチャでネイティブに統合した初のマルチモーダル生物基盤モデルとして公開された。SMILES/SELFIES表記の分子配列、分子構造、蛋白質配列、蛋白質構造、自然言語を共通の離散トークン空間に統一し、外部エンコーダや射影アダプタなしに単一の次トークン予測で全モダリティを生成・消費する。Qwen3(1.7Bおよび4B)をベースに3,044億トークンで継続事前学習しており、分子と蛋白質のインタラクションデータを含むクロスモーダルコーパスも含む。既存の生物基盤モデルが単一エンティティ型か単一モダリティ型かのどちらかに留まっていた制約を解消した。
あなたへの影響
創薬・蛋白質設計を行うチームは、単一モデルで分子と蛋白質の両方を生成・評価できる点を評価できる一方、1.7B/4Bの推論コストと専門データへの fine-tuning 必要性を事前に見積もっておくとよい。
推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。