2014年7月10日 星期四

大數據探索航空資料系列-達美航空

Logo/達美航空、攝影/Jerry

繼續本系列主題,本次介紹的應用是來自達美航空(Delta Air Lines),達美航空在這幾年扶搖直上,於2010年完成跟西北航空合併之後,成為全世界航線里程與客運機隊規模最大的航空公司。

這篇文章是2014年由SapientNitro廣告公司的數據分析師Myles Harrison所分享的文章,介紹它應用主成分分析(Principal Component Analysis)與K平均算法(k-means)去分析達美航空的飛機數據。


2014年7月3日 星期四

大數據探索航空資料系列-美國聯邦航空管理局

攝影/Jerry

最近筆者剛好讀到有關於大數據應用於航空資料分析,值得整理介紹給相關領域的朋友們參考。記得上Data Science Program的課程中,曾有學生邀請筆者至某航空公司擔任顧問,但筆者實在是分身乏術,所以希望這一篇能夠幫上航空界的忙。

其中一篇是2009年刊登在知名期刊Knowledge-Based Systems上的學術研究,主要是應用決策樹(Decision trees)從美國聯邦航空管理局(FAA)的數據來挖掘出可能會出現航空事故的特徵。研究所採用的分析工具為Megaputer Intelligence所開發的PolyAnalyst與挪威科技大學開發的Rosetta


2014年6月7日 星期六

蘋果的Big Data職缺,想進蘋果也要懂資料分析



最近全世界都吹起Big Data風潮,連蘋果(Apple)也一同蠢蠢欲動。最新的蘋果職缺中,今年2014年5月14日,蘋果的廣告部門開了一個高級軟體工程師的職缺。

筆者將職缺需求整理如下,提供相關的產業參考。

  1. 超過五年的軟體工程與資料分析的經驗
  2. 熟悉的工具須要包含Java、Python、Hadoop、R、SPSS、SAS
  3. 具有網路廣告的分析經驗
  4. 懂SQL,也就是過去大家熟悉的關聯式資料庫
  5. 理論的部分要懂資料探勘(Data mining)、資料匹配(Data matching)、機器學習(Machine learning)、 統計(Statistical techniques)、實驗設計(Experimental design)、最佳化(Optimization)。
  6. 具有大量數據的處理經驗,像是處理單位高達PB(Petabyte)以上的資料量。
  7. 具有解決真實問題的經驗
  8. 獨立的工作能力
  9. 關注資料分析的準確率與品質
以上主要的徵求內容,在台灣算是跨科系才能學到的能力,筆者舉例如下:
  • Java較偏資工系
  • R較偏統計系
  • Python與Hadoop可能偏資管系或資工系
  • SQL的部分偏資工與資管
理論的部分資管跟資工都可以選修到,有些還是必修,最佳化(Optimization)的課反而在工管系才可能碰到。當然現在有所謂的「資訊科學系」可能前述理論與工具都可能學習到。而個人覺得工具面的部份包含Java、Python、Hadoop、R這些開放原始碼,大部分都還是要靠學生自行學習。

最難的部分是在領域知識,像是蘋果的職缺需求就要網路廣告的分析經驗,對岸有些職缺需要懂金融、商業等領域知識的,這些領域知識在學校反而偏向是商業類科系才可能碰到,譬如筆者在大學修的廣告學、消費者行為,都需要跨修到企管系。

面對於這種職缺需要多年養成的職缺,企業不可能要求求職者百分之百都會以上技能,因為有些求職者即使會以上技能,個性與相處上反而也有問題,只能盡量取人格特質與技能較為平均的人才。i

以筆者的經驗,通常一般行情是很難請到具有上述能力的人才。因此筆者就根據企業所要發展的方向來決定這些能力的比重,像是工作在分析比重較高,就會著重在R與Python的能力,且具有商業分析概念,且具備「溝通」能力的人才,因為他一般的工作就是協助進行資料分析,並產製BI報表或平台的能力。而R跟Python本身就能完成這些事情,所以工作反而是在溝通與呈現,以及應用統計、資料探勘、機器學習等理論在實務上。

至於比較強調資料儲存與資料流通的,技術要求就會著重SQL、NoSQL上,因為這類人才就類似早期的資料庫管理師,強調在資料庫的配置,資料庫的管理,他的工作比較偏重資料庫、基礎設施、資訊安全,同時這個角色對於伺服器這些硬體設備也要有一定的了解。

最後,比較著重系統建置的,就會希望具有PHP、RoR、Python、C#與資料庫的能力。這個角色能夠提供前端與後端的系統建置,像是具有做過ERP、PLM這類大型系統的建置經驗,他們通常具備一些技能組合,像是PHP+MySQL、C#+MSSQL、RoR+PostgreSQL等等,他們負責將資料分析人員產生的雛型(Prototype)進行實踐。

這樣的分工組合就可以變成分析的人才專注在分析與商業應用探討,並做出雛形系統,資料庫人員專注協助資料庫管理與資訊安全,系統建置則專注將分析結果實施到企業系統上。

最後還要搭配專案經理或產品經理的角色,該角色具備領域知識與管理技能,如此一來就是一個理想的資料科學團隊雛型。

參考:
資料科學團訓班
資料爬理析 Python 實戰班2

2014年5月27日 星期二

10位國際頂尖資料探勘大師


近年來巨量資料(Big Data)的風行,讓沈寂20多年的資料探勘(Data Mining)技術又再度熱絡起來,並且延燒到企業中,像是前幾天甫落幕的活動,華碩與亞太資料探勘及知識發掘會議(Pacific-Asia Conference on Knowledge Discovery and Data Mining,簡稱PAKDD)共同舉辦的國際性大數據探勘競賽,就嘗試將為期5年的維修紀錄作為比賽的原始資料,要求參賽者推測出各元件每月報修數量的預測模型。
排名
學者
引用次數
1
Trevor Hastie
93283
2
Jiawei Han
88940
3
Jeffrey Ullman
88621
4
Rakesh Agrawal
80673
5
Jinyan Li
79323
6
John Canny
56691
7
Jeongkyu Lee
55065
8
Philip S. Yu
54020
9
Vipin Kumar
53489
10
Christos Faloutsos
46079


而每個領域都有所屬的專家,因此這邊筆者整理了國際頂尖10位的資料探勘專家,該排名依據是由Google Scholar中的文章引用次數(Cited),通常引用次數越高,也代表該名學者的學術聲望越高。

接下來讓我們一同向大師學習,依據排名這10位大師分別是Trevor HastieJeffrey UllmanJinyan LiJeongkyu LeeVipin KumarJiawei HanRakesh AgrawalJohn CannyPhilip S. YuChristos Faloutsos,以下表格包含排序與引用次數。

Trevor HastieJeffrey Ullman分別是史丹佛大學(Stanford University)的統計與電腦科學教授。其中Trevor Hastie教授以R語言作為主要工具,所撰寫的The Elements of Statistical Learning一書,就被引用高達一萬九千次,另一位教授Jeffrey Ullman則是知名的計算機概論書籍Compilers Principles Techniques and ToolsIntroduction to Automata Theory, Languages, and Computation的作者。接著Jiawei Han為伊利諾大學的電腦科學教授,這位教授大家應該就不陌生,因為JiaweiHan教授的書Data mining: concepts and techniques堪稱資料探勘界的經典書籍,該本書引用次數高達兩萬多,是超過前面兩位教授的。關於他的介紹,請大家直接參閱下面的報導:


接著是Rakesh Agrawal,為印度的數據挖掘之父,該名學者為微軟研究中心的研究員,曾在IBM 研究中心發表名為Fast algorithms for mining association rulesMining Association Rules between Sets of Items in Large Databases引用次數破萬次,使他位居於第四名。接著Jinyan Li為悉尼科技大學(University of Technology, Sydney)的教授,專長偏生物領域,發表多篇生物相關的資料探勘研究。

John Canny為加州大學柏克萊分校(University of California, Berkeley)的教授則為知名人工智慧的書籍Artificial intelligence: a modern approach作者,引用次數也高達兩萬多次。而Jeongkyu Lee為橋港大學(University of Bridgeport)的教授,跟Jinyan Li相同皆以多篇資料探勘生物應用研究,擁有較高的引用次數。

Jiawei Han同校並且也名列榜上的教授還有Philip S. Yu,而這兩位教授一個位於香檳分校,另一位於芝加哥分校,都是知名的資料探勘專家。Philip S. Yu教授以多篇資料探勘的理論研究為居第八,該學者的研究幾乎每篇都呈現破百的引用次數,像是Data mining: an overview from a database perspectiveAn effective hash-based algorithm for mining association rulesA framework for clustering evolving data streamsTop 10 algorithms in data mining等都是知名的文章。

接著是Vipin Kumar,他為明尼蘇達大學(University of Minnesota)的電腦科學教授,也曾與Philip S. Yu等人發表過Top 10 algorithms in data mining的文章,同時也是知名資料探勘書籍Introduction to Data Mining的作者,該書籍與Data mining: concepts and techniques都是台灣資料探勘課程的參考書籍。

最後一位Christos Faloutsos則是卡內基美隆大學(Carnegie Mellon University)的教授,該教授可以說是Graph mining的大師級人物,多篇Graph mining的研究,包含Graphs over time: densification laws, shrinking diameters and possible explanationsGraph evolution: Densification and shrinking diameters都是源於該學者

當然依照不同的角度,排名也就不同,其他排名在後的知名學者其實也不少,像是西門菲莎大學(Simon Fraser University)Jian Pei其實也是Data mining: concepts and techniques的作者之一,明尼蘇達大學(University of Minnesota)George Karypis教授就是知名推薦系統演算法Item-based collaborative filtering recommendation algorithms的作者。另外紐西蘭懷卡托大學(University of Waikato)Mark HallEibe Frank 兩位教授則是知名資料探勘軟體Weka的作者。而加利福尼亞大學歐文分校(University of California Irvine)的教授Padhraic Smyth則為提出資料庫知識發現(Knowledge-Discovery in Databases)流程的作者之一。

最後身為台灣人,台灣專家也要整理出來,依照Google Scholar的文章引用次數(Cited),名列前面的台灣專家還有台大網媒所的Chun-Wei LinChih-Jen Lin兩位教授,中研院的Ming-Syan Chen教授,三位都位居前30名中,所以台灣其實不簡單,小小一個國家就有三位專家在排名上。

從上面的資料可以發現,資料探勘領域專家多屬亞洲人居多,像是排名10大的就有4位亞洲人,Jiawei Han教授為上海人,Jinyan Li教授雖未說是哪裡人,但學士與碩士學位都是在中國拿的,因此可以推斷是亞洲人,Jeongkyu Lee教授則是韓國人,Philip S. Yu則是台灣出生,學士是在台大電機工程系拿的。所以在國內資料探勘專家其實不少喔!

下回筆者再來介紹機器學習的大師。


本文同步刊載於Data Science Program 資料科學計畫

2014年2月28日 星期五

13個必學的R軟體指令

整理列出常用的指令

GitHub網址:
https://github.com/rippleblue/Blog_R_code/blob/master/Useful%20functions.R


計算物件的長度
length(object)

計算物件維度
dim(object)

檢視物件架構
str(object)

檢視物件格式,有向量、矩陣、字元等
class(object)

檢視物件的名稱
names(object)

建立向量
c(object,object...)

以行的方式合併物件
cbind(object,object...)

以列的方式合併物件
rbind(object,object...)

印出物件
object

檢視物件最前面的資料
head(object)
head(object,10) #可檢視前10筆

檢視物件最後面的資料
tail(object)

列出環境目前有的物件
ls()

刪除單一物件或全部物件
rm(object)
rm(list = ls())

2014年1月31日 星期五

用巨量資料看春運:百度遷徙


每年春運一直是對岸逢年過節的熱門話題,而今年1月26日對岸百度首次以適地性服務 (Location Based Services簡稱LBS)技術,取得網民的移動資料,並整合百度地圖,以「百度遷徙」的主題,報導整個春運的狀況。

而本次也是對岸首次運用巨量資料(Big data)的概念來報導春運的運輸全貌,藉此我們也可以看到大數據在整個運輸政策、文化交流上,都有重要的發展意義。


首先我們可以從百度遷徙看到幾個功能「月份」、「時間」、「地點」、「遷入熱市」、「遷出熱市」、「最熱線路」,是整個查詢網站的主要功能。月份可以查詢1月16日起到整個春節時間,地點則可用文字搜尋城市,例如搜尋”上海”,即可了解上海的熱門遷入與遷出城市。

上面每個點代表一個城市,金黃色的線則表示動向,而右邊有1~10名的排序,方便我們觀察遷入與遷出的比例。以上海來說,1月29日除夕前一天早上10點,遷入的熱門省份為「江蘇」、「浙江」、「安徽」、「廣東」、「山東」、「江西」、「福建」、「河北」、「四川」、「湖北」。而遷出的熱門省份,也就是從上海移動到的省份為「江蘇」、「浙江」、「安徽」、「江西」、「湖北」、「廣東」、「山東」、「河南」、「臺灣」、「福建」。從上面的排名可以發現有趣的現象,遷入與遷出的省份前三名都不變,後面開始就有不一樣的事情發生,像是遷出有了臺灣,於是我們可以再點臺灣去看熱門的遷入遷出省份。


可從上圖發現,從各個省份要回家排名前六名的有「上海」、「香港」、「江蘇」、「北京」、「福建」、「江西」,這數據是否可以顯示「臺灣」與「上海」交流比「臺灣」與「北京」更活絡,從1月29日除夕前一天早上10點來講,這背後的意涵大家就可以自然衍生了。


另外一個角度是從台灣遷入過去的省份,如上圖排名前六包含「上海」、「香港」、「江蘇」、「北京」、「福建」、「江西」,從這裡是否也能觀察到旅遊業這塊的市場呢?

接著我們回到最首頁,可以看「遷入熱市」、「遷出熱市」、「最熱線路」,也可以觀察到許多某個時間點,對岸的人流動向。


像是遷入排名前三名為「北京」、「重慶」、「武漢」。


遷出排名前三名為「北京」、「上海」、「廣州」。


最熱門的線路為「成都到北京」、「北京到成都」、「上海到滁洲」,從上圖也可以觀察到對岸省份交流比較活絡的是「北京」與「成都」,遷入成都1,000人當中有249人來自北京,從成都遷出的1,000人,有329人來自北京。


還有幾個是對岸新聞報導上的一些資訊,供大家參考:
  • 1月9日鐵路訂票「12306網站」和手機端的總訪問量達84億次,相當於每個中國人都通過電腦或手機訪問了該網站6次多。
  • 1400萬人次使用支付寶搶票。
  • 北京流出的人口就集中在保定、邯鄲、石家莊、張家口、天津。
  • 截止目前為止中國手機網民達5億人口。

最後簡單做個結論,筆者從這個平台看到幾件事情:
  • 通常20%已經是大家都知道的事情,透過巨量資料我們反而可觀察到80%人流動向,也就是長尾理論的概念。
  • 兩岸旅遊業可透過這張圖了解市場,像是較具發展潛力的旅遊省份。
  • 兩岸運輸業透過這張圖了解運輸動脈,像是台灣過年間較愛飛的省份。
  • 可觀察到兩岸交流較為熱絡的城市,甚至是對岸在省份間較為熱絡的城市。
  • 商人也可以觀察哪個城市交流最為活絡。
  • 用大數據結合LBS的服務來看觀察運輸全貌。
  • 巨量資料帶來新聞傳播領域的一種新的概念,像是資料新聞學,透過資料來強化新聞報導內容。
當然整個平台還是有些資料視覺化設計上的小缺點,這邊筆者也把它記錄下來,以便日後碰到相關的案子可以查詢。

一些想法與建議:
  • 沒辦法查詢一天或某一個時段(如:下午六點到八點)的遷入與遷出比例。
  • 無法以時間序列的概念觀察到每個省份的流量。
  • 本平台PC採用Flash製作,瀏覽速度不夠流暢。
  • 本平台行動載具版本採靜態的方式呈現,無法做細部查詢





參考資料:
  1. 大數據裏看春運:實時地圖上的春運全景
  2. 百度遷徙顯示北京榆林張家口來包旅客多
  3. 百度遷徙地圖看大數據 網友大讚接地氣!
  4. 百度遷徙:透過大數據看春運