Fundamental Research in Large Language Models
Panduan belajar dari slide Minggu 1 (Rifki Afina Putri, UGM). Setiap bagian punya penjelasan sederhana, demo interaktif, dan kotak kritis yang menunjukkan kelemahan atau perdebatan di dunia riset.
0. Peta besar: Input → Model → Output
Seluruh slide diatur dengan satu pipeline. Hafalkan ini dulu, sisanya tinggal mengisi.
| Bagian | Pertanyaan riset | Topik di slide |
|---|---|---|
| Input | Bagaimana teks diubah jadi angka yang bisa diolah? | Fitur manual vs deep learning, Word2Vec, GloVe, FastText, contextualized embedding |
| Model | Bagaimana model dilatih dan seberapa besar? | Pretraining & fine-tuning (BERT), scaling laws, in-context learning, RLHF |
| Output | Bagaimana kita tahu hasilnya bagus? | Closed vs open-ended, BLEU/ROUGE, BERTScore, manusia, Chatbot Arena, LLM-as-judge |
1. Language Model (LM)
1.1 Apa itu LM?
LM adalah model machine learning yang memprediksi kata berikutnya. Ia tidak memberi satu jawaban, tetapi distribusi probabilitas untuk semua kemungkinan kata.
Klik tombol untuk menghasilkan kata.
Perhatikan: "on" (0,45) dan "off" (0,44) hampir sama. Jika top-k = 1, model selalu memilih "on" (deterministik). Jika k lebih besar, hasil bisa berbeda tiap kali. Itulah sebabnya ChatGPT bisa memberi jawaban berbeda untuk pertanyaan yang sama.
1.2 Definisi formal
- Tujuan: hitung probabilitas urutan kata
P(W) = P(w₁, w₂, …, wₙ). - Tugas terkait: probabilitas kata berikutnya
P(wₙ | w₁ … wₙ₋₁). - Keduanya ekuivalen karena aturan rantai probabilitas:
P(W) = Πᵢ P(wᵢ | w₁…wᵢ₋₁). Jadi, jika bisa menebak kata berikutnya, kamu bisa menilai seluruh kalimat. - Untuk LLM kita memakai token (potongan kata, misalnya "play" + "ing"), bukan kata utuh. Dengan token, kata baru atau salah ketik tetap bisa diproses.
1.3 Aplikasi
Autocomplete, autocorrect, terjemahan mesin, code completion (Copilot), dan chatbot (ChatGPT, Gemini, Claude). Semuanya adalah variasi dari "prediksi token berikutnya".
1.4 Evolusi LM
| Era | Jenis | Contoh | Kemampuan |
|---|---|---|---|
| 1990-an | Statistical LM | n-gram | Membantu tugas spesifik |
| 2013 | Neural LM | Word2Vec | Fitur umum (task-agnostic) untuk tugas NLP tipikal |
| 2018 | Pre-trained LM | ELMo, BERT, GPT-1/2 | Pretraining + fine-tuning; dipindah ke banyak tugas |
| 2020 | LLM | GPT-3/4, ChatGPT, Claude | Pemecah tugas umum lewat prompt |
2. Input: representasi fitur
Komputer hanya mengerti angka. Pertanyaannya: bagaimana mengubah teks jadi angka yang mengandung makna?
2.1 Tradisional vs deep learning
| ML klasik | Deep learning | |
|---|---|---|
| Fitur | Dirancang manual oleh manusia (feature extraction) | Dipelajari otomatis oleh jaringan saraf |
| Pipeline NLP | Deteksi bahasa → tokenisasi → stemming → stopwords → ekstraksi fitur → modeling | Pre-processing → embedding → neural network → output |
| Kekurangan | Butuh pakar, tiap bahasa/tugas dibuat ulang | Butuh data dan komputasi besar, sulit ditafsirkan |
2.2 Word embedding: Word2Vec (Mikolov, 2013)
Setiap kata menjadi vektor. Kata dengan makna/penggunaan mirip letaknya berdekatan. Slide menunjukkan hubungan seperti man→woman sejajar dengan king→queen, juga bentuk kata kerja (walking→walked) dan negara→ibu kota.
2.3 Varian: GloVe dan FastText
- GloVe: memakai statistik kemunculan bersama (co-occurrence) di seluruh korpus → menangkap konteks global. Word2Vec hanya melihat jendela lokal.
- FastText: kata dipecah jadi character n-gram (mis. "play", "-ing", "player") → kata langka atau kata baru tetap punya vektor.
2.4 Masalah: embedding statis → contextualized embedding
Word2Vec/GloVe memberi satu vektor per kata. Padahal "bank" bisa berarti banyak hal. Contextualized embedding (ELMo, BERT, GPT) menghasilkan vektor yang berubah sesuai kalimat.
Pilih kalimat di atas.
Di slide, BERT memetakan "bank" ke kelompok berbeda: lembaga keuangan, tepi/lereng tanah, gedung bank, punggungan, susunan benda, manuver pesawat. GloVe hanya satu titik.
3. Model
3.1 Pretraining dan fine-tuning (contoh BERT)
BERT = Bidirectional Encoder Representations from Transformers. Paradigma dua langkah:
| Step 1: Pretraining | Step 2: Fine-tuning | |
|---|---|---|
| Data | Teks besar tanpa label: Wikipedia (~2,5 miliar kata) + BooksCorpus (~800 juta kata) | Dataset berlabel kecil (mis. email spam / bukan spam) |
| Tugas | Masked Language Modeling (tebak kata [MASK]) + Next Sentence Prediction | Supervised learning: sentimen, QA, klasifikasi, dll. |
| Hasil | Model yang "mengerti bahasa" secara umum | Model ahli satu tugas |
Contoh MLM: input [CLS] how are [MASK] today doing [SEP] → model menebak "you" (probabilitas tertinggi), lalu "they", "your", dst. Karena BERT melihat kiri dan kanan kata yang ditutup, ia disebut bidirectional. [CLS] menandai awal dan vektornya dipakai untuk klasifikasi, [SEP] memisahkan kalimat.
| Model | Arah | Catatan |
|---|---|---|
| BERT | Dua arah (Transformer encoder) | Bagus untuk memahami teks |
| GPT | Kiri ke kanan | Cocok untuk menghasilkan teks |
| ELMo | Dua LSTM terpisah (kiri→kanan dan kanan→kiri) lalu digabung | Gabungan dangkal, bukan interaksi dua arah penuh |
3.2 Scaling laws
| Model | Parameter | Data (token) | Compute (FLOPs) |
|---|---|---|---|
| BERT-base (2018) | 109 juta | 250 miliar | 1,6e20 |
| GPT-3 (2020) | 175 miliar | 300 miliar | 3,1e23 |
| PaLM (2022) | 540 miliar | 780 miliar | 2,5e24 |
Kaplan dkk. (2020) menemukan hukum pangkat (power law): kalau parameter, data, dan compute dinaikkan, loss turun secara teratur dan dapat diprediksi. Di grafik log-log, hubungannya berupa garis lurus. Dari slide: L(N) = (N/8,8·10¹³)^−0,076.
Eksponen kecil (−0,076) artinya: untuk menurunkan loss sedikit, parameter harus dinaikkan berkali-kali lipat. Mengalikan ukuran model 10x hanya menurunkan loss sekitar 16%.
3.3 In-context learning (ICL)
Brown dkk. (2020): GPT-3 (175 miliar parameter) bisa mengerjakan tugas baru hanya dari contoh di dalam prompt, tanpa mengubah bobot. Kemampuan ini tidak diprogram, melainkan muncul (emergent) setelah model cukup besar. Pada grafik TriviaQA, makin banyak contoh (zero → one → few-shot) makin tinggi akurasi, dan pada 175B few-shot menyamai/melampaui SOTA hasil fine-tuning.
3.4 RLHF (Reinforcement Learning from Human Feedback)
Reinforcement learning: agent belajar lewat coba-coba pada sebuah environment. Agent melakukan action, environment memberi reward. Pada RLHF, "reward" berasal dari preferensi manusia. Ini yang mengubah GPT-3 mentah menjadi asisten yang mengikuti instruksi (Ouyang dkk., 2022).
4. Output: evaluasi LLM
Evaluasi yang ketat itu wajib sebelum model dipakai, agar akurat, adil, dan andal.
4.1 Closed-ended vs open-ended
| Closed-ended | Open-ended | |
|---|---|---|
| Jawaban benar | Satu atau sedikit | Ribuan kemungkinan; ada yang lebih baik atau lebih buruk |
| Contoh | Klasifikasi sentimen, extractive QA | Menulis cerita, merangkum, chatbot |
| Evaluasi | Otomatis, seperti ML biasa (akurasi, F1) | Sulit; butuh metrik khusus atau manusia |
4.2 Benchmark closed-ended
- Single-task: SST & IMDB (sentimen), SNLI & MultiNLI (entailment: premis mendukung/bertentangan/netral dengan hipotesis), SQuAD & NaturalQuestions (QA).
- SuperGLUE (multi-task, mengukur "kemampuan bahasa umum"): BoolQ & MultiRC (membaca teks), CB & RTE (entailment), COPA (sebab-akibat), ReCoRD (QA + penalaran), WiC (makna kata), WSC (koreferensi).
- MMLU (Hendrycks, 2021): 57 tugas pengetahuan, dari aljabar abstrak hingga sejarah Eropa.
4.3 Evaluasi teks open-ended
(a) Content overlap (BLEU, ROUGE, METEOR, CIDEr): menghitung kemiripan kata/n-gram antara hasil model dan teks acuan manusia. Cepat dan murah. (b) Model-based: BERTScore mencocokkan kata via cosine similarity embedding BERT, BLEURT adalah model regresi berbasis BERT yang menilai tata bahasa dan kesesuaian makna.
Coba ubah jadi "They strolled to the supermarket." Maknanya hampir sama dengan acuan, tetapi skor overlap rendah. Sebaliknya, kalimat di atas mirip secara kata tetapi maknanya berbeda (toko kelontong vs toko perkakas) dan skornya tetap lumayan.
(c) Human evaluation adalah standar emas: nilai fluency, koherensi, faktualitas, commonsense, gaya, tata bahasa, dst. Kekurangannya lambat, mahal, tidak konsisten/sulit direproduksi, bisa salah paham pertanyaan, dan skor antar studi tidak boleh dibandingkan walau dimensinya bernama sama.
(d) Side-by-side: Chatbot Arena (Chiang dkk., 2024): pengguna membandingkan dua model anonim secara acak, memilih A, B, seri, atau keduanya buruk. Hasilnya jadi peringkat model dari voting crowdsourced.
(e) LM evaluator (LLM-as-judge): LLM dipakai sebagai juri tanpa referensi (MT-bench, AlpacaEval). Jauh lebih murah dan cepat dengan korelasi tinggi terhadap manusia. Tetapi waspadai korelasi palsu: preferensi pada jawaban panjang, bias posisi (biasanya diatasi dengan pengacakan), dan self-bias GPT-4 yang menyukai jawaban gaya GPT-4.
4.4 Takeaways dari slide
- Closed-ended: pikirkan apa yang diuji (keragaman, kesulitan) dan external validity (apakah hasil berlaku di dunia nyata).
- Open-ended: overlap berguna untuk tugas dengan keragaman rendah; evaluasi chatbot masih masalah terbuka.
- Tantangan: konsistensi dan contamination.
- Sering kali penilai terbaik adalah kamu: baca output model, jangan hanya andalkan angka, dan rilis sampel luas dari output sistemmu.
5. Rangkuman dan cara belajar
| Topik | Masalah yang diselesaikan | Kelemahan |
|---|---|---|
| Fitur manual | Awal NLP | Mahal, tidak skalabel |
| Word2Vec/GloVe/FastText | Makna kata dalam vektor | Statis, bias |
| BERT/ELMo/GPT | Makna sesuai konteks | Besar, butuh pretraining mahal |
| Scaling laws | Memprediksi manfaat model besar | Loss ≠ kemampuan; batas data |
| In-context learning | Tugas baru tanpa training | Sensitif prompt; bukan belajar permanen |
| RLHF | Selaras dengan preferensi manusia | Reward hacking, sycophancy, bias |
| Overlap / BERTScore | Evaluasi otomatis | Dangkal / bergantung model |
| Manusia / Arena / LLM judge | Menilai kualitas sebenarnya | Mahal / bias / bias model |
- Gambar pipeline dari ingatan, isi semua topik.
- Jelaskan tiap kotak "Kritis" dengan kata-katamu sendiri.
- Baca abstrak paper berurutan: Word2Vec → BERT → Kaplan → Brown (GPT-3) → Ouyang (RLHF).
- Jawab kuis di bawah sampai kamu tidak perlu menengok catatan.
6. Kuis latihan
Skor: 0/0 dijawab dari 8