LLM Security
LLM Security berfokus pada ancaman keamanan spesifik yang muncul dari penggunaan Large Language Models seperti GPT, Claude, Llama, dan model sejenis. LLM memiliki permukaan serangan yang unik karena sifat generatif dan aksesibilitasnya.
Ancaman Spesifik LLM:
- Prompt Injection - Serangan yang memanipulasi input prompt untuk mengubah perilaku model. Terbagi menjadi direct (user-to-model) dan indirect (third-party-to-model melalui konten yang diambil model).
- Jailbreaking - Teknik melewati safety guardrails model untuk menghasilkan konten berbahaya.
- Data Leakage - Model secara tidak sengaja mengungkap data training sensitif melalui outputnya.
- Insecure Output Handling - Output model yang tidak divalidasi dapat menyebabkan XSS, SQL injection, atau RCE pada aplikasi downstream.
- Excessive Agency - Model diberi akses ke tools atau API yang terlalu luas tanpa pengawasan yang memadai.
- Model Theft - Mencuri model melalui extractive queries atau menyusup melalui supply chain.
OWASP LLM Top 10 menyediakan daftar risiko tertinggi untuk aplikasi berbasis LLM, dengan Prompt Injection menempati peringkat pertama.
Mitigasi LLM: Input validation & sanitasi, output encoding, human-in-the-loop untuk tindakan kritis, rate limiting, monitoring log, dan regular red teaming terhadap model.