~歡迎企業洽談包班需求 ~
「大數據/人工智慧」 同步招生中 !!
課程緣起
同樣被稱為網路爬蟲(Web Crawler)的網頁資料擷取是一種從網頁上取得頁面內容的技術,與常見搜尋引擎使用之爬蟲技術不同的是其更側重於轉換網路上非結構化資料為便於儲存和分析的結構化資料。
網路爬蟲也涉及到網路自動化,透過電腦軟體模擬了人的瀏覽,可以減少許多耗費人力的網路工作。因此,網路爬蟲的用途非常廣泛,包含社群網路的輿情分析、價格比較、氣象資料監測及自動填寫表單等。
課程目標
本課程將帶領學員從網路爬蟲所需的Python基礎入門,由淺入深的透過主題式實戰演練的方式讓學習效率大幅提升。
適合對象
‧ 資料科學家、資料工程師
‧ 公司各部門與各階層決策人員
先備知識
需要python程式基礎,建議有部分 HTML、CSS selector觀念尤佳。
課程內容:每日上課時間09:00~17:00、中間午休一小時、共計二日14小時
| 課程主題 | 課程內容 |
| 爬蟲必備Python基礎 | ‧ List與Dict資料結構 ‧ 流程控制與迴圈 ‧ 資料匯出 |
| 基礎爬蟲技巧 | ‧ GET/POST傳送請求 ‧ 開發人員工具之監聽應用 ‧ Python擷取網頁原始碼 ‧ UrlEncode與UrlDecode |
| 爬蟲資料處理 | ‧ HTML與JSON資料結構 ‧ CSS Selector網頁原始碼解析 ‧ 開發人員工具之HTML解析應用 ‧ 網頁資料萃取及表格化 |
| 實戰演練(一) | ‧ 批踢踢推文擷取 ‧ 中央社及蘋果日報擷取 ‧ PCHome商品資料擷取 |
| 進階爬蟲技巧 | ‧ Headers及Cookie偽裝 ‧ Selenium 模擬瀏覽器行為 ‧ Javascript控制網頁元件 |
| 實戰演練(二) | ‧ 會員(自動)登入案例實作 ‧ 批踢踢多頁面擷取案例實作 ‧ Instagram照片下載 ‧ Facebook文章擷取 |
* 課程執行單位保留調整課程內容、日程與講師之權利

