- https://arxiv.org/abs/1605.08104
- Havard
- 正味シングルカラムで 8ページしかない。 図版、referenceをいれて12ページ
- ビデオデータから未来を予測するという形で、教師なし学習
- 2方向にローテーションする顔や、ドライブデータで評価していて、非常にうまく言っているように見える。
- ネットワークは以外に単純。予測誤差を予測する、と言うかたちでカスケードしていく。個々のネットワークにLSTMが入っている。
2016年10月6日木曜日
2016年10月2日日曜日
Building High-level Features Using Large Scale Unsupervised Learning,
```Building High-level Features Using Large Scale Unsupervised Learning,
Quoc V. Le, Marc’Aurelio Ranzato, Rajat Monga, Matthieu Devin, Kai Chen, Greg S. Corrado, Jeffrey Dean, and Andrew Y. Ng, CML 2012: 29th International Conference on Machine Learning, June, 2012.```
猫の概念を自動的に学習した、ということで有名になったあれ。
- 9-layer sparse autoencoder。局所受容野は入っている。
- 10M 枚の200x200ピクセルイメージ
- 1,000 台 16,000 コアで 3日学習
- 非同期SDG
2016年2月7日日曜日
Bitcoin: A Peer-to-Peer Electronic Cash System
- Satoshi Nakamoto
- https://bitcoin.org/bitcoin.pdf
シングルカラムでわずか9ページしかない。簡潔。
- Timestamp Server がアイデアのもと?t時点のデータをt+1時点のデータのハッシュに組み込むことで、t のデータがt-1よりも先行していることを保証する。Timestamp server では、ハッシュをUsenetに投稿するなどする。
- Hashのchainが最長のものが真のchainである、というアイディアが本質なのだろうか。
- Mining と ネットワークの維持が一体化している点も巧み。
仕掛けはなんとなく理解できたが、いろいろわからない。
- Transaction が世間的に認められるには、そのTransaction がふくまれた後続Transactionができたことを確認しないといけないように思うのだけど、それにはある程度の計算が必要で10分ぐらいかかりそう。運用としてどうなってるんだろう。
- この種のものが信用されるには初期にある程度のサーバが参加していなければならなさそうだが、それをどうやって実現したのか。
2015年12月18日金曜日
DIANNE: Distributed Artificial Neural Networks for the Internet of Things
http://dl.acm.org/citation.
DLフレームワーク。パイプラインのステージを別のデバイスに実装することができる。OSGi をベースにしたAIOLOS上に実装ということなので、Javaらしい。JNIでCUDAを呼び出す。ラズパイやエジソンで動かしている。
レイテンシ重視なのでミニバッチしないらしい。ミニバッチしなくて、GPGPUの性能が出るのかと思うけど、とりあえずでているようだ。不思議。
2015年7月17日金曜日
Optimizing Shuffle Performance in Spark
Optimizing Shuffle Performance in Spark
- [http://www.cs.berkeley.edu/~kubitron/courses/cs262a-F13/projects/reports/project16_report.pdf]
- Spark では相対的にMapとReduceが高速化されるので、shuffleがボトルネックになる。
- shffuleの対策として、mapの出力を圧縮する方法があり、他のDBでうまく言っているカラム単位で圧縮するのを試してみたがうまく行かなかった。
- ファイルの数がMapper 数 x Reducer数になっているのが問題と考え、同じコア上で動作するMapperの出力は同じファイルにするようにしたら速くなった。
論文ではなくてレポート?
2015年7月14日火曜日
圧縮センシングの数理
圧縮センシングの数理
- 田中 利幸 - [https://www.jstage.jst.go.jp/article/essfr/4/1/4_1_39/_pdf]
解説論文。圧縮センシングとは、スパースなベクタを限定的な観測を繰り返した結果から類推する という問題。1-ノルムを用いることで線形計画問題に持ち込む?凸なので簡単?
2015年6月29日月曜日
Project Adam: Building an Efficient and Scalable Deep Learning Training System
Project Adam: Building an Efficient and Scalable Deep Learning Training System
- Trishul Chilimbi Yutaka Suzue Johnson Apacible Karthik Kalyanaraman
- Microsoft Research
- Adam というのがシステム名
- ImageNet で評価。
- より少ないマシンで効率よく学習しているという主張。
- 2 bilion のモデル
- 複数のモデルをパラメータストアで同期
- 個々のモデルそのものも複数のノードに分散
- データサーバ - 10-100TBものデータを更に変形して食わせる。変形のために専用のサーバ群を用意する。
- パラメータサーバとの通信
- convolution についてはパラメータ数が小さいので普通にやる
- full connection の部分は、データ量が多くなるので、activation and error gradient vectorを送って、計算はparameter Server 側で行う。これでデータ通信量が MN から k (M+N) になる。
- parameter serverの実装
- shard table を使った分散実装。shard size1MB
- delayed persistence - loss を許容している。
登録:
投稿 (Atom)
