2014/4/30

C#捉取網頁資料-其一

在C#建一個簡單的Console專案

然後安裝以下套件                   

image

image

image

語法上其實還蠻單純的

不過在建立新物件時,因為會用到套件的東西所以需要自己手動指定解析,IWebDriver 與 PhantomJSDriver(),將游標移至這2個項目旁邊按右鍵即可

image

此處一個簡短範例如下

            IWebDriver driver = new PhantomJSDriver();
var url = "http://en.wikipedia.org/wiki/Web_scraping";
driver.Navigate().GoToUrl(url);
var tocElements = driver.FindElements(By.CssSelector(".toctext"));



在我這個範例中,最重要的是那個 FindElements有s與沒有s …顧名思義,有s指的是複數的狀況,沒有s指的是單數的狀況;而在CssSelector中的參數要如何取得呢? 簡單就使用Firefox中的FireBug+FirePath即可


image


另外一個小技巧就是在C#的程式中設定適當的中斷點,然後利用「即時運算視窗」再確認我們捉下來的資料是不是我們需要的


因為有時候需要的文字資料裡面會有不需要的東西,則可以事先運用文字相關函數加以整理….

2014/4/29

Big Data 作業流程技術資源

因為Blogger系統的限制要放在側邊有點麻煩,我直接另開一篇

將我個人蒐集在 Onenote 的資料也整理到這邊

後續會陸續更新… (因為Big Data 的議題熱度高啊~)

更新log:

(1)2014-4-29

(2)2014/4/30 更新Web Scraping資料

Moe
資料科學家作業流程
相關技術連結
Ⅰ-定義問題  
Ⅱ-取得資料 Web_scraping 相關技術

利用網站:
https://import.io/
捉取網頁資料

自己寫程式:
https://developer.yahoo.com/yql/ Yahoo的YQL
Python套件 Beautiful Soup、Scrapy

RUBY套件 Watir   Nokogirl

C#套件  Html Agility Pack、 WatiN 、 CsQuery

JavaScript 套件 PhantomJS、CasperJS

我個人有試過在C#底下使用過jQuery+PhantomJS+WebDriver的方式捉取網頁資料
  方式如下:在C#開一個Console專案→安裝以上套件→在Firefox中觀察網站結構確定要捉取資料型態→匯出 ;另外安裝一套 CsvHelp可以簡化輸出作業

輔助工具:
另外由於HTML不是很標準化的語化,所以可以套過FireFox下的Firebug、Firepath來快速掌握網站架構(可快速瞭解DOM與CSS)

可參考書籍:
Mining the social Web

Ⅲ-模型分析  
Ⅳ-行動應對  

2014/4/27

Azure安裝Rstudio

Azure安裝Rstudio

前提:Ubuntu已架設完成

主要分成2個部分

(1)安裝Apache伺服器
   執行以下指令
   sudo apt-get install apache2
   sudo apt-get install libapache2-mod-proxy-html
   sudo apt-get install libxml2-dev

(2)安裝Rstudio 安裝很簡單,但記得在Azure管理介面中將8787 Port打開

   安裝R
   sudo apt-get install r-base
  
   安裝Rstudio(For Ubuntu)
   sudo apt-get install gdebi-core
   sudo apt-get install libapparmor1  # Required only for Ubuntu, not Debian
   wget http://download2.rstudio.org/rstudio-server-0.98.507-amd64.deb
   sudo gdebi rstudio-server-0.98.507-amd64.deb

原廠安裝說明:
http://www.rstudio.com/ide/download/server

打網址後面加上:8787 就可以登入 Rstudio介面
http://<server-ip>:8787
帳號權限管理方式就如同一般Ubuntu指令語法 useradd
 
 
*** 幾乎沒有什麼難度,想想如果這是在以前的話,這會是多麻煩的一件事呢?!

Azure中Ubuntu安裝桌面環境與遠端桌面連線

 

Azure是微軟提供的雲端解決方案,微軟目前很認真的在推這塊領域
微軟的大頭目已經喊出了「Mobile First, Cloud First」
很明顯的要將微軟主要的獲利來源往這塊領域移動,所以Azure提供的不只是微軟自家產品、作業庫系統、資料庫系統的解決方式,已經成為了跨平台方案的提供者

一般人比較會使用到的是自建虛擬主機的方案
設定起來蠻簡單的
就是每台主機都是各自獨立,所以需要設定如下
(1)主機名稱
(2)使用帳號
(3)使用者密碼

其實就想成是從前利用Vmware在自己的電腦再另外安裝一套作業系統一樣
只是安裝的速度更快,例如安裝好一套可以用的 Ubuntu 大約只要10分鐘吧
如果是在自己的電腦上安裝並且要自訂主機名稱,很難這樣快速達成
你設定好的主機名稱,後續在微軟的網域底下 cloudapp.net
想像一下從前自架主機還要搞定IP之類的麻煩事,現在微軟全部幫你搞定

當然一開始架好的 Ubuntu 是Server版本的沒有桌面環境可以使用,如果你和我一樣是GUI派的,就請再自行安裝桌面環境吧

在登入前記得先在Azure管理介面中設定以下Port

(1) 22 port 指定給 SSH (文字介面的遠端連線);

(2) 3389 Port 指定給 RDP  (遠端桌面連線)

利用 SSH (使用 Putty)的方式遠端登入你的 Ubuntu 主機

執行以下指令
sudo apt-get update   (先確定目前Update是最新版)
sudo apt-get upgarde  (這個step會安裝很久...)
sudo apt-get install ubuntu-desktop   (接近2Gb的檔案待安裝,安裝圖形介面)
sudo apt-get install xrdp  (安裝遠端RDP登入)
sudo /etc/init.d/xrdp start (執行xrdp)

OK,打完收工

後續再從Azure管理介面中下載連接檔,就可以在Windows中利用內建的遠端連線進行連接囉

資料科學的入門試題

在資料科學中,怎樣是一個好的第一步呢?

最近在做 Social network Anaysis,可以發現這種重視連線(點與點之間)關係的案例具備有一定的實用性;不過也因為太過複雜,我認為初學者最多就是利用現成套件描繪出圖形,對於進階議題的探討幫助可能不大。不過在Social network Anaysis中,計算距離的概念,其實在很多初階的多變量課本中都有提到,我認為是相當好的入門題,有趣卻又不失直覺 (總不能一開始就叫初學者去學時間序列分析吧…)

想像一個簡單的例題如下:

  A B C D E F
核四興建 1 2 10 9 5 9
反服貿 9 8 1      
破音歌神 2   9 4 5 4
石虎保育 10 10 1 2 5 2

這是一個蠻常見的例子,有7個人對於4種議題的贊同程度予以評分。分數由1~10分進行評比,為了簡化,先假設都是整數…1表示非常不同意,10表示非常同意… 而常常會有人針對特定議題不想要表態,所以有的資料有所缺漏。

在實務上,我們可以把議題置換為其他主題;例如你是一個電子商務老闆,你應該會支持特定的人應該會特別支持特定的商品的這種想法。那些沒有填資料的人,你可以想像是有潛力的客戶,但到底會不會購買呢?? 以我的例子來看 B 應該是比較接近A,而比較不接近 C ,如果你花了大筆的錢針對 B 促銷 “破音歌神” 這項產品,應該是沒有太大的效果…

當然因為我給的例子很簡單,如果今天是有20萬筆資料呢?有1000項商品呢? 那我們適必需要資料科學加以協助…

(1)個體間的差異?最簡單直覺的想法就是用距離的方式

例如 A與C的距離程度 = 9+8+7+9 > A與b的距離程度=1+1+0

  A C 差異(取絕對值)
核四興建 1 10 9
反服貿 9 1 8
破音歌神 2 9 7
石虎保育 10 1 9

 

  A B 差異(取絕對值)
核四興建 1 2 1
反服貿 9 8 1
破音歌神 2   跳過去不算
石虎保育 10 10 0

當然你事後會發現這樣的方式有很多問題,但是反過來說在 Big Data 的狀況下,很多時候不特別採用抽樣技術,反正我手邊的資料就是母體,只要分析的結果具備商業價值也就夠了… 一般來說距離求算的技術至少有3種。

在此例中,我們也發現在計算距離中,處理 Null 值的議題…同樣的東西如果要在Excel不利用VBA方式而用函數直接處理的話,往往要寫成很長的公式。而且Excel Sheet對於任意抽2個來計算並不是很擅長,所以我們會使用類似 Python或是R這種語言來協助。

在算出了距離後呢?

(2)接下來就是要找出那些是相似的?

舉例來說,如果以A為例的話,平均距離計算如下 (定義=總歫離/有評分的議題)

image

可以將 A B 視為是較接近的族群,而A C 之間的距離最遠,彼此間的差異最大

(3)進階處理 Null ? Null值可以用其他值加以取代嗎

回到原先的範例(把一開始的表格再複製一次)

  A B C D E F
核四興建 1 2 10 9 5 9
反服貿 9 8 1      
破音歌神 2   9 4 5 4
石虎保育 10 10 1 2 5 2

B D E F 都有不願意表態的項目

但是我們可以試著將 B 在”破音歌神”的Null值用A的值來取代?

Why 為什麼不用D的值來取代呢? 這樣子的演算法的規則是什麼?主要是因為在這例中,B與A的距離最為接近,自然是採用最接近的來進行取代。

 

其他衍生議題

(1)D 與 F 之間的距離最短為0,但是他們同意都不對「反服貿」議題表態..違反了一開始我們設定的簡易演算法規則

(2)E這位仁兄看來是採取二手政策對於各項議題都採取相對中立的態度…有什麼手法可以將這種誤差予以排除?

(3)在這個範例中,每個人只針對一個議題表達一項意件。而在實務中,往往一個人對於一項產品,不會只購買一次;例如:愛打籃球的高中男生 A,可能在一年內就消費了5雙nike籃球鞋…

所以我說這樣的例題,可以一再衍生很多資料科學中的進階議題;而隨著問題的複雜化,在程式語法中所要熟悉的東西就會從基本的變數設定、資料輸入/輸出、一定延伸至函數、Class撰寫等等議題…

否則對一個半路出家但有志於資料科學的人卻和資工系的學生進行一樣的訓練方式,這樣不是很奇怪嗎?