JapanTech

[ロボット学習チームセミナー] ミラノ大学 マッテオ・パピーニ教授とミラノ工科大学 ジャンマルコ・ジェナルティ博士による講演(7月23日)

RIKEN AIPオンラインセミナー。7月23日、イタリアの研究者2名が方策勾配のサンプル効率とグラフトリガー型バンディットについて講演。

日時
7月23日(木) · 15:00〜16:30 JST
場所
Open Space at the RIKEN Nihonbashi Office (on-site for RIKEN members only) · オンライン
主催者
理化学研究所 革新知能統合研究センター
言語
EN
出典
Doorkeeper
概要
本セミナーはロボット学習チームが主催するオンライン開催で、理研日本橋オフィスでの現地参加(理研メンバー限定)も可能です。強化学習の理論に関する最新研究を扱う2件の招待講演が行われます。 ミラノ大学のマッテオ・パピーニ教授は「Reusing Data in Policy Gradients to Improve Sample Efficiency」と題し、直近k個の方策から収集した軌跡データを再利用する新しい多重重要度サンプリング推定量に基づく、アクターオンリーの方策勾配アルゴリズムを紹介します。サンプル効率に関する理論的保証と、近接方策最適化(PPO)におけるデータ再利用の予備的な結果も示されます。 ミラノ工科大学のジャンマルコ・ジェナルティ博士は「Bridging Rested and Restless Bandits with Graph-Triggering」と題し、腕(アーム)間のグラフ構造によって、あるアームを引くことが別のアームの変化を引き起こす様子をモデル化する、restedバンディットとrestlessバンディットを統合するグラフトリガー型バンディットの枠組みを提案します。増加型(rising)および減衰型(rotting)バンディットに対するアルゴリズムと理論的保証についても論じます。
コミュニティについて

本セミナーシリーズでは、海外の研究者を招き、強化学習や逐次意思決定に関する最先端の研究を、日本国内のAI研究者やエンジニアに向けて発表しています。講演では理論的な結果と実践的なアルゴリズムの保証の両方が扱われ、Zoomによるオンライン開催のため、少人数の現地参加者に加え日本各地の参加者もリモートで参加できます。

#reinforcement-learning#policy-gradient#multi-armed-bandits#robot-learning#academic-seminar#machine-learning#research-seminar#online-seminar#online-learning