Big Data 大數據工程師就業養成班  第4期  林同學
前言

我從大學到碩士班都是做實驗物理的研究。以前在做實驗的時候,就經常需要用到程式輔助來做一些自動化處理和數據分析。畢業後到了要找工作之際,無意之間在網路上發現了台北資策會所開設的大數據分析就業養成班,在聽完說明會後,個人覺得這是一個不錯的方向與選擇。因為近年「大數據」和「雲端運算」等時髦的名詞開始紅到台灣來,大家越來越重視數據分析人員。所以就決定來台北資策會這裡參加為期五個多月的「Data Engineer 巨量資料分析就業養成班(iSpan資展國際Big Data巨量資料分析就業養成班的前身)」課程訓練,以期能夠讓自己更深入地瞭解到現在這些技術的概觀是什麼樣子

心得分享

對於非資訊科系的同學來說,在大學時期學到的程式技能其實是非常基礎的。若是個人對撰寫程式還有一些基本概念的話,參加資策會就業養成班的課程就還不至於太過吃力。我個人的看法是:「若想參加大數據分析的就業養成班,一定要有自己的想法,不要隨波逐流,先做點功課了再來參加,學習效果可能會更好。」我覺得大數據分析算是一門已經是現在進行式且火紅的學問和技術,而且需要跨領域的人才融入、共同集思廣益,才有辦法創造價值。而在這複雜的領域中,每個人都可以各取所需,學到自己想要的部分。

在這將近6個月的課程當中,學到了很多,從基礎的 IT 知識、一些大數據知識與技術以及數據挖掘的概念等,最重要的是學習良好的團隊合作。

在這個班裡,會以分組的型式進行各種專題式的學習。初期的課程是訓練基礎程式能力,這一階段的專題結合了Java 和 JDBC 的程式能力和技術,加上關連資料庫的知識去連接 Microsoft SQL Server,團隊合作做出一個概念上的電影院訂票系統,這部分除了開始了解 Java 的程式的基礎外,最重要的是得去克服關聯式資料庫 Transaction(交易) 的概念及控制處理。第二階段主要是學習 Linux 和虛擬化技術以及Hadoop生態系的種種,這階段算是架構上的技術以及概念的學習,但是我覺得這是我學習最多的地方。這階段的專題是要合作架設出多台實體機器,且上面架設多台虛擬機器組成的 Hadoop cluster 系統,並在上面架設各種各樣的應用工具,中間使用YARN 來做資源分配,運作計算則使用 MapReduce 框架,並結合 Spark 以及其衍生介面。最後階段學習了數據挖掘以及R語言等數據分析的概念及技術,然後整合全部所學,進行2到3週,充實的期末專題研究。我們這組的專題主題為台灣交通事故熱點與醫療資源分析,為此架設一套多台虛擬機的Hadoop cluster 並結合 SparkR,也利用R語言套件在 Rstudio 介面上進行 K-means method 群集分析和決策樹分析,而資料來源是從政府 Open Data取得的資料集,涵蓋全台灣103 年到105 年間全台車禍。最後將分析好的資料放入 MongoDB,再結合地理圖資和前端技術在網站上展現出視覺化的分析結果。中間跌跌撞撞失敗了很多,但最後有也有個小成果,並放在 Amazon EC2 的雲端機器上展示。

在上完這班的所有課後,讓我初步了解到以 IT 的角度解決問題的想法。而且在做專題的時候,會遭遇到各式各樣的難題得要自己想辦法解決。除了可以詢問相關授課老師之外,更多時候還是要自己想辦法找尋答案,在邊找答案邊和同學們討論的過程中,慢慢就會學到一套面對問題時,該如何自我找尋解答的資源和方法。我相信這套方法是非常有價值的,因為世界發展飛快,我們永遠要學習,及早學會如何學習並融入其中,是讓自己不斷增長的最佳辦法。

後來我找工作的時候,很多面試官對我們的期末專題研究都滿感興趣,這也是讓我有更多機會找到理想工作的一大助力。最後我找到一份需要做 IoT 裝置後台以及數據分析的工作。讓我有機會的是我們專題的呈現,讓面試官可以很清楚了解我們學到的能力,包含簡報表達能力以及成果的專業技術。第二個就是我自己本來的專業,做實驗物理剛好就是會遇到很多感應器的數據以及一些的硬體問題。而 IoT 要解決的問題,剛好〝物理〞這個領域的能力也能有所幫助。所以當時我找工作時也特別往這個方向找,最後如願找到了份不錯的工作。

有志來參加這個班的資料科學同好,務必瞭解到此一領域〝學無止境〞,就端看大家用甚麼角度去學習事務。以上分享是這班的課程對我個人的幫助,每一個人對自己的職涯都會有不同的規劃與打算,希望藉此分享能夠幫助到大家。最後也很歡迎大家可以加入巨量資料分析的行列,大家一起多多交流。(結業期別:BDSE04)