ラベル ML の投稿を表示しています。 すべての投稿を表示
ラベル ML の投稿を表示しています。 すべての投稿を表示

2017年10月11日水曜日

Continuous control with deep reinforcement learning

Actor-critic のDeep Learning 版?
  • DQNというかQ-learningではベストなactionを検索する必要が有るので、action spaceが広かったり連続だったりすると扱えない。なのでActor-Criticをベースにする。ActorはQやVとは独立のネットワークでactionを決定するのでこのような問題がない。
  • 学習を安定化するために、Qネットワークμネットワークにそれぞれtargetネットワークを作り、そちらを更新するようになている。これは [minh et al 2013] でやられていることと同じらしい。
  • Off ポリシなので、exploration が用意。
​

2017年8月23日水曜日

Action-Conditional Video Prediction using Deep Networks in Atari Games

ATARIゲームの盤面とアクションを入力にして次の画面を予測する。
encoding network とdecoding networkを組み合わせる。
真ん中にRNNを入れるバージョンと、入力画面を数フレーム分アンロールして
与えるバージョン(feedforwardと呼んでいる)の2つを作ってテストしている。
予測性能を見ると、場合によってどちらが良いかが変わるようだ。
さらにDQNの学習に予測した画面を用いることで性能が向上すると主張している。スコアをみるとほとんど変わってないが、QBertでは大きく向上しているように見える。
QBert ってこんなゲームなのか。。
https://www.youtube.com/watch?v=karPYs22ACc
​

2016年10月2日日曜日

Building High-level Features Using Large Scale Unsupervised Learning,


```Building High-level Features Using Large Scale Unsupervised Learning,
Quoc V. Le, Marc’Aurelio Ranzato, Rajat Monga, Matthieu Devin, Kai Chen, Greg S. Corrado, Jeffrey Dean, and Andrew Y. Ng, CML 2012: 29th International Conference on Machine Learning, June, 2012.```

猫の概念を自動的に学習した、ということで有名になったあれ。


- 9-layer sparse autoencoder。局所受容野は入っている。
- 10M 枚の200x200ピクセルイメージ
- 1,000 台 16,000 コアで 3日学習
- 非同期SDG

2015年12月18日金曜日

DIANNE: Distributed Artificial Neural Networks for the Internet of Things


http://dl.acm.org/citation.cfm?id=2836130

DLフレームワーク。パイプラインのステージを別のデバイスに実装することができる。OSGi をベースにしたAIOLOS上に実装ということなので、Javaらしい。JNIでCUDAを呼び出す。ラズパイやエジソンで動かしている。

レイテンシ重視なのでミニバッチしないらしい。ミニバッチしなくて、GPGPUの性能が出るのかと思うけど、とりあえずでているようだ。不思議。