Hierarchical Softmax — Prinsip Efisiensi Softmax pada Vocabulary Berskala Besar
Hierarchical Softmax adalah metode yang digunakan untuk mengurangi biaya komputasi Softmax pada model dengan ukuran Vocabulary yang sangat besar. Alih-alih menghitung probabilitas untuk seluruh kata dalam Vocabulary secara langsung, metode ini memecah prediksi kata menjadi serangkaian keputusan biner berdasarkan jalur dalam struktur tree.
08/08/2026
OOV (Out-of-Vocabulary) — Mengapa AI Kesulitan Menghadapi Kata yang Belum Pernah Dilihat
OOV (Out-of-Vocabulary) terjadi ketika model AI menemukan kata yang tidak tercakup dalam Vocabulary yang sudah dimilikinya. Masalah ini sangat umum pada sistem NLP generasi awal karena kata biasanya disimpan dan diproses sebagai satu unit utuh. Jika sebuah kata tidak pernah muncul di Vocabulary, model tidak memiliki representasi yang sesuai untuk memahaminya. Keterbatasan inilah yang kemudian mendorong berkembangnya pendekatan seperti Subword Tokenization dan Character-Level Representation, yang memungkinkan model memanfaatkan bagian-bagian lebih kecil dari sebuah kata.
09/02/2026
Sampled Softmax — Prinsip Aproksimasi Perhitungan Softmax pada Training Vocabulary Besar
Sampled Softmax adalah teknik optimasi untuk menangani masalah klasifikasi dengan ukuran Vocabulary yang sangat besar. Alih-alih menghitung full Softmax terhadap seluruh kelas pada setiap proses training, metode ini hanya menggunakan kelas target dan beberapa negative samples untuk memperkirakan probabilitas serta arah gradient.
08/08/2026
SentencePiece — Prinsip Pembelajaran Subword yang Tidak Bergantung pada Bahasa
SentencePiece adalah Tokenizer yang mempelajari potongan subword secara langsung dari keseluruhan teks tanpa harus memisahkan kalimat menjadi kata terlebih dahulu. Berbeda dengan pendekatan Tokenizer tradisional yang biasanya menentukan batas kata berdasarkan spasi atau aturan linguistik tertentu, SentencePiece membangun vocabulary dengan mencari pola karakter yang sering muncul dalam data teks asli. Pendekatan ini membuat SentencePiece dapat digunakan secara konsisten pada berbagai bahasa, termasuk bahasa yang memiliki batas kata kompleks seperti bahasa Jepang, Korea, dan Mandarin.
07/18/2026
Tokenization — Cara Model Mengubah Teks Menjadi Unit yang Dapat Diproses
Tokenization adalah proses memecah teks bahasa alami menjadi unit token yang dapat dipahami oleh sistem komputasi, kemudian mengubahnya menjadi bentuk sequence numerik yang dapat digunakan model. Model tidak membaca teks seperti manusia membaca kalimat, tetapi melakukan perhitungan berdasarkan integer index dan representasi vektor. Karena itu, Tokenization menjadi salah satu fondasi utama dalam pipeline NLP dan LLM.
07/28/2026
Vocabulary (Vocab) — Dasar Kumpulan Token dalam Model AI
Vocabulary (Vocab) merupakan kumpulan token yang sudah ditentukan sebelumnya dan dapat dikenali oleh sebuah model. Sebelum diproses oleh model, teks perlu diubah menjadi representasi numerik karena model bekerja dengan angka, bukan dengan kalimat dalam bentuk aslinya. Proses ini dilakukan dengan memecah teks menjadi token, lalu mencocokkan setiap token tersebut dengan ID yang tersedia di dalam vocab.
07/28/2026
Weight Tying — Mengapa Model Berbagi Ruang Representasi untuk Memahami dan Menghasilkan Kata
Weight Tying adalah teknik pada Transformer yang menggunakan kembali Embedding Matrix untuk dua tahap berbeda: mengubah token input menjadi vector representation dan memproyeksikan representasi output untuk memprediksi token berikutnya. Dengan berbagi parameter yang sama, model tidak perlu membangun ruang representasi terpisah untuk membaca dan menghasilkan kata. Keduanya merujuk pada struktur semantik yang sama.
08/22/2026