MISC

2020年

マウスの行動探索における報酬分布に依存した学習率の調整

人工知能学会全国大会論文集
  • 太田 宏之
  • ,
  • 佐鳥 玖仁朗
  • ,
  • 宝田 悠
  • ,
  • 荒毛 将史
  • ,
  • 守本 祐司
  • ,
  • 石塚 俊晶
  • ,
  • 高橋 達二

JSAI2020
開始ページ
4B3GS101
終了ページ
4B3GS101
記述言語
日本語
掲載種別
DOI
10.11517/pjsai.jsai2020.0_4b3gs101
出版者・発行元
一般社団法人 人工知能学会

本研究では、強化に関する学習率が報酬の分散にどのように依存しているのかを探索オペラント課題を用いて検証した。動物の生息環境には、膨大な数の行動の選択肢が存在し、かつ、食餌(報酬)が得られる選択肢は時空間的にスパースに分散している。過酷な環境に適応している動物の探索戦略をQ学習モデルで解析することで、探索行動の性質を理解できるだけでなく、巨大状態空間へのQ学習の適用方法の改善が期待される。しかし、探索行動に関するQ学習を用いた既存の研究では2選択課題が用いられており、訪問頻度の少ない複数の選択肢に関する探索行動の解析ができなかった。そこで、本研究では5本腕バンディット課題をマウスに課し、その探索行動を解析した。得られたデータに対して、正と負の報酬予測誤差のそれぞれに対して異なる2つの学習率を持ったQ学習モデルをフィッティングした。その結果、報酬の出現頻度が低い場合、正の学習率が負の学習率に対して約6倍の大きさを示した。報酬が得にくい厳しい環境においては、失敗の経験は反映されず、1回の成功体験の重みが増強されていることが示された。

リンク情報
DOI
https://doi.org/10.11517/pjsai.jsai2020.0_4b3gs101
CiNii Research
https://cir.nii.ac.jp/crid/1390848250119721216?lang=ja
ID情報
  • DOI : 10.11517/pjsai.jsai2020.0_4b3gs101
  • CiNii Articles ID : 130007857218
  • CiNii Research ID : 1390848250119721216

エクスポート
BibTeX RIS