- VLDB09
- Greenplum と UCB
- さまざまな機械学習アルゴリズムが並列DB上で実装可能だということを述べている
- 実装は無い
- MAD は Magnetic, Agile, Deep。
- Magnetic は何でもかんでも引きつける、ぐらいの意味で、データを選別せずになんでも入れるというぐらいのニュアンスか?
- Deep はDeep Learningとは関係なく、深い解析、ぐらいの意味だろう。
- MADという言葉はまったく流行らなかったが、中身は大変今日的で、Spark SQLやHiveMallなどで実現されている、という位置づけになるのか。
2016年11月4日金曜日
MAD Skills: New Analysis Practices for Big Data
2014年10月16日木曜日
OSv—Optimizing the Operating System for Virtual Machines
ここからダウンロード。
うわさの OSv。このペーパーを読んで何が驚いたかって、”v”が下付きではなく上付きだったこと。えー、そうなの??スライドとかでも、上付きになってるの見たこと無いけど。。
- 単一アプリをラッピングしてIaaS上で動かす軽量OS。JavaVMが最初のターゲットだったが、今は色々動く。
- C++でスクラッチから書かれている。
- プロセスは一個だけしか動かないが、スレッド的に複数のアプリを動かすことが実は可能。ただしメモリは共有される。
- それどころか、アプリとカーネルの間でもメモリ空間は共有。というか、基本的にカーネルとユーザランドの区別が無い。アプリにOS機能を直接リンクするイメージに近い。
- 1秒で起動するとのこと。
- 用途はアプライアンスだろうか。
- 直接の対抗馬はコンテナ技術か。コンテナよりはきっちりアイソレーションできそう。マイグレーションとの相性も良さそう。コンテナもマイグレーションできるそうだが、プロセスマイグレーションの経験から行くと、VMマイグレーションとは比較にならないほど面倒なので。
2014年7月3日木曜日
Flume Java
#FlumeJava: Easy, Efficient Data-Parallel Pipelines
Craig Chambers, Ashish Raniwala, Frances Perry, Stephen Adams, Robert R. Henry, Robert Bradshaw, Nathan Weizenbaum
Google, Inc
Proceeding of PLDI '10 Proceedings of the 2010 ACM SIGPLAN conference on Programming language design and implementation
Google論文。MapReduceを置き換えるものとして開発されたJavaのデータ並列ライブラリ。記述力としてMapReduceのスーパーセットであるという主張。複数ノードにまたがる(かもしれない)一連のデータに対して、データ並列でワークフローを書く。この形だとMapとReduceの区別が無く、ほぼフラットに書ける。GroupByという演算があり、これがMapReduceのシャッフルフェーズに相当する。
データ構造はimmutable で次々にデータ構造を作るようになっているが、実際には評価が遅延され、最後の結果を評価したところで、処理のツリーを最適化してから評価するという作り。最終的にはかなり複雑な評価式も一段のMapReduceに落として処理しているとのこと。
たしかに、MapReduceでグリグリ書いていくよりも、ずっと楽だろう。
2010年の論文という点を割り引いても、新規性があるとは思えないが、やはり超大規模環境でちゃんとやってるのが偉いっていうことなんだろう。
Craig Chambers, Ashish Raniwala, Frances Perry, Stephen Adams, Robert R. Henry, Robert Bradshaw, Nathan Weizenbaum
Google, Inc
Proceeding of PLDI '10 Proceedings of the 2010 ACM SIGPLAN conference on Programming language design and implementation
Google論文。MapReduceを置き換えるものとして開発されたJavaのデータ並列ライブラリ。記述力としてMapReduceのスーパーセットであるという主張。複数ノードにまたがる(かもしれない)一連のデータに対して、データ並列でワークフローを書く。この形だとMapとReduceの区別が無く、ほぼフラットに書ける。GroupByという演算があり、これがMapReduceのシャッフルフェーズに相当する。
データ構造はimmutable で次々にデータ構造を作るようになっているが、実際には評価が遅延され、最後の結果を評価したところで、処理のツリーを最適化してから評価するという作り。最終的にはかなり複雑な評価式も一段のMapReduceに落として処理しているとのこと。
たしかに、MapReduceでグリグリ書いていくよりも、ずっと楽だろう。
2010年の論文という点を割り引いても、新規性があるとは思えないが、やはり超大規模環境でちゃんとやってるのが偉いっていうことなんだろう。
2014年1月4日土曜日
クラウド上の仮想マシンの安全なリモート監視機構
OS-126 クラウド上の仮想マシンの安全なリモート監視機構 重田一樹、光来健一九工大のグループ。IaaSクラウド上でIDSを用いるはなし。 仮想計算機を使ってホスト側にIDSを動かすのはよくある話。 クラウドだと、ホスト側が必ずしも信頼出来ないので、 IDS本体はリモートの信頼できるサイトで稼働させる、というおはなし。 RemoteTransというのがシステム名?
技術的にはTransCallという、ゲスト内にシステムコールをフックして ホスト側に飛ばすライブラリをネットワーク経由で飛ばせるようにしているようだ。
IaaS事業者は信頼するが、管理VMから他のVMを管理している管理者は信頼しない、すなわち VMMは信頼できるが、他のVMは信頼出来ない、という脅威モデル。 かなりピンポイントというか、今ひとつリアリティのないモデルのような気がするが。。
登録:
投稿 (Atom)