講演情報

[P3-26]ストリーミング強化学習による VLA モデルの訓練

*迫田 真太郎1、高橋 達二1 (1. 東京電機大学)

キーワード:

Reinforcement Learning、Vision Language Model、Vision Language Action Model

本研究では,事前学習済みVLMに対してストリーミング強化学習を適用することによりVLAモデルを訓練する手法を検証する.軽量なVLMであるQwen3.5-0.8Bに,行動のためのネットワークと行動価値関数のためのネットワークを追加し,ストリーミング強化学習での方策勾配法でモデルの訓練を行う.結果として,VLMに対する強化学習が単一のGPUを用いて約8.9FPSの動作速度で実行できること,および,言語指示に従う行動の学習が可能であることが示された.