R&D_AIリサーチエンジニア
【案件概要】
こちらの企業は、健康寿命の延伸や医療格差の是正に取り組む、創業フェーズのスタートアップです。現在当社では、大規模なエピゲノム・オミクスデータを活用した次世代AI基盤モデルの研究開発を推進しています。1兆トークン級の大規模データ、数十B規模のモデル、100ノード超の大規模GPUクラスター環境を前提とした、難易度の高い研究開発テーマに挑戦しています。分散学習のボトルネックを解消し、計算効率を極限まで高めながら、数十B規模のモデルをスクラッチから事前学習できるプロフェッショナルを募集します。研究者・エンジニアと連携しながら、バイオ領域における基盤モデル開発の中核メンバーとして、以下のようなテーマに取り組んでいただきます。AI × バイオデータ研究開発プロジェクトにおいて、以下の業務を担当します。1.データ解析・研究開発: 大規模オミクス / 医療データの前処理・品質評価, 探索的データ分析(EDA)・可視化・仮説検証, 特徴量設計・データ表現の設計, 学習用データセットおよび評価用データセットの整備。2.機械学習 / 深層学習モデル開発: 機械学習モデルの設計・実装・評価, ベースライン構築およびモデル改善, 表現学習 / 自己教師あり学習 / 基盤モデル開発, GPU環境を用いたモデル学習・実験運用, モデル性能評価、誤差分析、改善提案。3.大規模学習・開発基盤: 分散学習ジョブの設計・運用・最適化, 学習パイプライン / 開発基盤 / 実験管理基盤の構築, 大規模データI/Oや再現性を考慮した研究開発フローの整備, MLOps / ML Systems 観点での改善。4.研究プロセス・チーム連携: 評価指標設計・ベンチマーク設計, 実験の再現性担保、ログ管理、ドキュメント化, 分析結果のドキュメント化・社内共有, 研究者・データサイエンティスト・エンジニアとの協働。
【開発環境】
1兆トークン級の大規模データ、数十B規模のモデル、100ノード超の大規模GPUクラスター環境。GPU環境を用いたモデル学習・実験運用、分散学習ジョブの設計・運用・最適化、学習パイプライン/開発基盤/実験管理基盤の構築、大規模データI/Oや再現性を考慮した研究開発フローの整備、MLOps/ML Systems観点での改善。AWS/GCP等のクラウド環境。
【必須スキル】
【募集要項・条件】
必須スキル: 以下1, 2のいずれかの領域において、「実装・最適化」の経験を有すること。1.アーキテクチャ設計と事前学習の実務経験: Transformerベースのモデル、またはMamba等のState Space Models (SSM) を用いた大規模モデルの設計・実装経験。基盤モデルのScaling Lawsに基づき、1兆トークン級の学習に必要な計算リソースを定量的で見積もる能力。数B〜数十B規模のモデルにおける事前学習のハイパーパラメータ・チューニングおよび学習安定化の経験。2.大規模分散学習のエンジニアリング: PyTorch FSDPやDeepSpeed等のライブラリを、モデルの規模やネットワーク帯域に合わせてカスタマイズ・チューニングした経験。マルチノード環境におけるGPU間の通信ボトルネックの解消、および1兆トークン規模のデータに対する効率的なI/Oパイプラインの設計経験。Ring Attentionまたはシーケンス並列(Sequence Parallelism)の実装を通じた、単一GPUメモリをに収まらないコンテキストの学習最適化。歓迎スキル: チーム開発の経験(Git運用、レビュー文化)。AWS / GCP 等クラウドの利用経験。表現学習 / 自己教師あり学習 / Transformer / Autoencoder / 大規模言語モデルの研究開発経験。GPU環境でのモデル学習の経験。分散トレーニング / HPC環境の利用経験。統計モデリング / 因果推論 / ベイズ統計などの知識。不均衡データ / 時系列 / マルチモーダルデータ解析の経験。論文実装・研究再現・ベンチマーク構築。Pythonによるデータ分析・機械学習の実務経験。機械学習または統計モデリングの経験(分類 / 回帰 / 時系列 / 異常検知など)。データ分析結果を整理し、仮説・改善案まで言語化できる能力。論理的に課題を分解し、実装・検証まで進められる力。求める人物像: 未踏性の高い技術課題に主体的に向き合える方。研究と実装の両方に関心を持てる方。難易度の高い問題を構造的に捉え、粘り強く改善できる方。専門の異なるメンバーと協働しながら開発を進められる方。社会実装まで見据えて技術開発に取り組みたい方。