Berikut adalah silabus 20 sesi @1,5 jam untuk topik:
“Web Scraping Berita Online Menggunakan Python untuk Analisis Tren Topik Terkini”
Tahap 1: Dasar Web Scraping dan Tools (Sesi 1–5)
-
Pengenalan Web Scraping & Use Case Berita Online
-
Apa itu web scraping
-
Studi kasus scraping situs berita (Detik, Kompas, CNN Indonesia)
-
Legalitas dan etika scraping
-
-
Dasar HTML dan Struktur DOM
-
Elemen HTML: tag, class, id
-
Cara membaca struktur web berita
-
Tools bantu: Inspect element (browser), DevTools
-
-
Instalasi dan Pengantar Library Python untuk Scraping
-
Instalasi Python dan pip
-
Pengenalan
requests,BeautifulSoup,lxml -
Scraping sederhana dari situs HTML statis
-
-
Scraping Judul & Tanggal Berita dari Situs Detik
-
Ambil judul dan tanggal dari homepage Detik
-
Parsing data dengan BeautifulSoup
-
Menyimpan ke CSV
-
-
Scraping Isi Berita (Konten Artikel) dari Link Detail
-
Ambil link dari homepage
-
Masuk ke halaman detail dan ekstraksi isi
-
Penanganan konten multi-paragraf
-
️ Tahap 2: Pendalaman Scraping dan Teknik Lanjutan (Sesi 6–10)
-
Scraping Kompas dan Perbandingan Struktur HTML
-
Perbedaan struktur antar situs
-
Modularisasi fungsi scraping
-
-
Scraping dari CNN Indonesia dan Navigasi Pagination
-
Navigasi ke halaman berita sebelumnya
-
Loop scraping multi-halaman
-
-
Handling Error dan Anti-Bot Protection
-
Penanganan status code
-
User-Agent dan headers
-
Delay & random sleep
-
-
Penyimpanan ke Database (SQLite / CSV / JSON)
-
Format penyimpanan data scraping
-
Membuat database SQLite dan insert data hasil scraping
-
-
Scraping Terjadwal dengan Cron atau Task Scheduler
-
Konsep scraping berkala (daily scraping)
-
Menjadwalkan script dengan
scheduleatau cronjob
Tahap 3: Analisis dan Visualisasi Data (Sesi 11–15)
-
Pra-Pemrosesan Data Berita
-
Membersihkan teks dari tag HTML
-
Normalisasi tanggal, penghilangan karakter tak penting
-
Analisis Kata Kunci dan Word Frequency
-
Tokenisasi
-
Hitung frekuensi kata populer
-
Visualisasi: Bar Chart
-
Pengenalan Wordcloud dan Visualisasi Tren
-
Instalasi
wordcloud -
Membuat wordcloud dari kumpulan berita
-
Time Series: Topik Berita Berdasarkan Waktu
-
Distribusi jumlah berita berdasarkan tanggal
-
Tren topik dari kata kunci (contoh: “politik”, “ekonomi”)
-
Visualisasi Interaktif dengan Plotly / Streamlit
-
Pembuatan dashboard berita sederhana
-
Filter berdasarkan waktu, kata kunci
Tahap 4: Proyek dan Finalisasi (Sesi 16–20)
-
Proyek Mini: Scraper Kompas Otomatis (judul, tanggal, isi)
-
Buat script end-to-end
-
Simpan ke SQLite dan CSV
-
Proyek Mini: Scraper CNN Indonesia dengan Pagination
-
Penggabungan scraping multi-halaman
-
Normalisasi konten
-
Analisis Komparatif Topik dari 3 Situs
-
Gabung data dari Detik, Kompas, CNN
-
Lihat tren dan overlap topik
-
Deploy Aplikasi Analisis Tren ke Web dengan Streamlit
-
Membuat UI Streamlit
-
Tampilkan hasil scraping dan analisis
-
Presentasi Proyek Final dan Review
-
Presentasi hasil scraping + analisis
-
Refleksi dan saran pengembangan ke tahap lanjut (NLP, Sentiment Analysis, dsb)