- R
- R cheat sheet (Google Drive)
- R functions for Regression Analysis
- R Reference Card
- R functions for Time series Analysis
- R Reference Card for Data Mining
- R Cheat Sheet
- Data Analysis the data.table way
- Interactive Web Apps cheatsheet by R studio
- Data Visualisation with ggplot2 cheatsheet by R studio
- Package Development with devtools cheatsheet by R studio
- Data Wrangling cheatsheetR markdown cheatsheet
- R Markdown Reference guide
- R Data Management cheatsheet
- R Cheatsheet for graphical parameters
- Python
- Python 2.7 Quick Reference Sheet
- Python Cheat Sheet by DaveChild
- Python Basics Reference sheet
- Python Debugger Cheatsheet
- NumPy / SciPy / Pandas Cheat Sheet
- Python OverAPI cheatsheet
- Python Decorators cheatsheet
- Python 2.4 Quick Reference Card
- Python 3 Cheat Sheet
- Python Language & Syntax Cheat Sheet
- SQL
- MySQL Cheatsheet by Dave child
- SQL Cheat sheet
- SQL in one page
- MySQL Reference guide
- Visual SQL Joins
- SQL for dummies
- Hadoop
- Hadoop for Dummies cheatsheet
- Getting Started Apache Hadoop Reference Card
- Hadoop Command Line cheatsheet
- Working with HDFS from the command line – Hadoop Cheat sheet
- Hive Function cheatsheet
- SQL to Hive cheatshe
- Spark
- DZone
- Scala cheatsheets 1
- Scala cheatsheets 2
- Scala from DZone Reference Card
- Spark cheatsheet on github
- Scala on Spark Cheatsheet
- Essential Apache Spark cheatsheet by MapR
- Machine learning
- Choosing the right estimator Machine Learning cheatsheet
- Patterns for Predictive learning cheatsheet
- Machine learning algorithm cheat sheet for Microsoft Azure
- Machine Learning cheatsheet Github 1
- Machine Learning cheatsheet Github 2
- Machine Learning which algorithm performs best?
- Cheat sheet 10 machine learning algorithms R commands
- Patterns for Predictive Analytics
2015年7月29日 星期三
50個資料科學工具速查表(R、Python、Hadoop、Spark、Machine learning)
以下為國外整理的資料科學工具速查表,包含常見的工具R、Python、Hadoop、Spark,以及機器學習(Machine Learning)理論。
2015年4月20日 星期一
情緒分析(Sentiment Analysis)的作法與商業價值
情緒分析(Sentiment Analysis)是繼文字探勘(Text Mining)之後,近年被熱烈討論的議題。過去學者普遍探討的是如何把一句話非結構化轉結構化的方法,像是各式演算方法,包含監督式學習(Supervised learning)、半監督式學習(Semi-supervised learning)、非監督式學習(Unsupervised learning)方法都有大量討論,各種文字探勘工具也應運而生,現在透過R、Python也都能很快做到這些事情。
我們隨著學者的腳步,可以發現隨著時代演進,解析文字的科技發展,在20年間有很快速的變動。從最早的網頁資料探勘(Web Data Mining)、文字探勘(Text Mining),慢慢的演進到近10年討論的情緒探勘(Sentiment Analysis)與意見探勘(Opinion Mining),再到這2年的情緒分析系統(Sentiment Analysis System)這樣的議題,都是為了要解決我們大量文字的閱讀需求,因為人類每一天不斷產生文字與內容已經超乎我們想像。
要如何從大量文字裡面掏金,有幾個步驟非常重要,筆者整理如下:
- 選定目標
- 爬文解析
- 斷字斷句(非結構化轉結構化)
- 情緒分析
- 資料視覺化
粗略上面的步驟,都有個別的議題需要討論。從1、2、3、5步驟都有現成工具可以使用,最難的反而是第4的步驟「情緒分析」。
針對「情緒分析」筆者在有限的時間下,整理這10年大部分學者所做的幾個方法
,供有興趣的朋友參考:
- 基於文件為基礎的情緒分類(Document-based sentiment classification)
- 以主觀的概念做情緒分析(Subjectivity and sentiment classification)
- 以外觀(屬性)為基礎的情緒分析(Aspect‐based sentiment analysis)
- 建立情緒字彙的情緒分析(Lexicon‐based sentiment analysis)
還有其他關於情緒分析有趣的議題,包含從2005年開始有學者針對線上評論的評等預測(Review rating prediction)、2006年有學者開始研究意見比較(Comparative opinions)、以及2007年開始有學者研究意見垃圾偵測(Opinion spam detection)等。
這些方法的重點都是要嘗試從大量的文字中,辨識出正面與負面等情緒,好讓這些結果產生出商業價值,但事實上還是有許多問題需要被解決,包含像是特殊的嘲諷句子,如:「這手機很棒,我從來都無法開機。」以及像是中文文法、日文文法等等問題,因此做的精準做得好,還需要投入大量的資源與成本,更重要的是要跨領域,包含找中文系、英文系等熟稔語言的專家,加入一些修辭學的概念等等,甚至是筆者同事建議的語音、圖像辨識專家,因為在大數據的時代講究的是跨領域的整合,單從文字上解析的變數還不夠,還需要更多元的資料,才能做得更好。
綜觀來說,情緒分析的商業價值,除了可以提早了解顧客對於產品或公司的觀感,進而調整營運策略方向。在產品銷售的途中,也可以捕捉顧客對於產品的體驗。筆者也曾使用類似的方法協助某企業了解他們顧客對於產品的評價狀況。筆者同事也曾上述方法進行服貿事件的文字解析。不管在銷售前、銷售後,企業在了解市場的方法上,除了問卷,透過情緒分析我們有值得參考的新選擇。
參考資料:
2014年7月10日 星期四
大數據探索航空資料系列-達美航空
Logo/達美航空、攝影/Jerry
繼續本系列主題,本次介紹的應用是來自達美航空(Delta Air Lines),達美航空在這幾年扶搖直上,於2010年完成跟西北航空合併之後,成為全世界航線里程與客運機隊規模最大的航空公司。
這篇文章是2014年由SapientNitro廣告公司的數據分析師Myles Harrison所分享的文章,介紹它應用主成分分析(Principal Component Analysis)與K平均算法(k-means)去分析達美航空的飛機數據。
2014年7月3日 星期四
大數據探索航空資料系列-美國聯邦航空管理局
攝影/Jerry
最近筆者剛好讀到有關於大數據應用於航空資料分析,值得整理介紹給相關領域的朋友們參考。記得上Data Science Program的課程中,曾有學生邀請筆者至某航空公司擔任顧問,但筆者實在是分身乏術,所以希望這一篇能夠幫上航空界的忙。
其中一篇是2009年刊登在知名期刊Knowledge-Based Systems上的學術研究,主要是應用決策樹(Decision trees)從美國聯邦航空管理局(FAA)的數據來挖掘出可能會出現航空事故的特徵。研究所採用的分析工具為Megaputer Intelligence所開發的PolyAnalyst與挪威科技大學開發的Rosetta。
訂閱:
文章 (Atom)



