Lewati ke konten utama

LLM Guardrails

Pola engineering untuk membatasi perilaku LLM di sistem AI produksi — sanitasi input, validasi output, revert-on-failure, dan isolasi advisory.

5 menit baca·Menengah·Konsep·25 Agu 2026
ai systemsllm

LLM Guardrails

Apa yang Dibangun

Artikel ini mensintesis pola LLM guardrail dari tiga sistem produksi: A2A Brainstorm (audit koherensi dengan micro-fix terjaga dan revert-on-failure), MD-AME (Prompt Firewall + classifier keamanan Gemini pada setiap topik dan skrip), dan edge-polymarket-agent (AI advisor terisolasi dari critical path eksekusi).

Masalah

LLM berhalusinasi, membatalkan dirinya sendiri, menyuntikkan konten tidak aman, dan menghasilkan output malformed. Di sistem produksi, Anda tidak dapat mempercayai respons LLM mentah. Anda membutuhkan lapisan yang menyanitasi input, memvalidasi output, menolak atau mengembalikan hasil buruk, dan mengisolasi AI advisory dari aksi yang memiliki konsekuensi dunia nyata.

Mengapa Masalah Ini Sulit

  1. Over-correction — memperbaiki satu masalah dapat merusak konten tidak terkait.
  2. False positive — filter terlalu agresif memblokir output valid.
  3. Latensi — classifier keamanan menambah panggilan API per item.
  4. Advisory creep — saran LLM perlahan menjadi ketergantungan eksekusi.
  5. Non-determinisme — guardrail yang sama harus menangani bentuk output LLM yang bervariasi.

Model Mental untuk Pemula

Guardrail adalah pos pemeriksaan keamanan bandara, bukan tujuan. Setiap item melewati inspeksi sebelum melanjutkan. Jika inspeksi gagal, item ditolak atau dikembalikan — tidak mendapat stempel "cukup oke". AI advisory seperti pemandu wisata: saran berguna, tetapi tidak pernah diizinkan menerbangkan pesawat.

Persyaratan dan Kendala

Jenis guardrailA2A BrainstormMD-AMEPolymarket agent
Sanitasi inputToleransi ekstraksi JSONPrompt Firewall (sanitize_trend_input)N/A (data pasar terstruktur)
Validasi outputAudit koherensi + guardrailsClassifier keamanan pada topik/skripHard gate probabilitas
Revert on failureRevert micro-fix jika validasi gagalContentSafetyRejection HALTBlokir trade, tanpa fallback
Isolasi advisoryN/AN/AAI advisor read-only, failure-isolated
Audit trailState sesi di PostgreSQLsafety_audit_logs trail immutableLog audit alokasi
Keamanan kredensialEnv ref *_CREDENTIAL_REF sajaMaster Key Crypto, zero-loggingRahasia env-only

Gambaran Arsitektur

Alur Eksekusi

Guardrail input (Prompt Firewall MD-AME)

  1. Potong input ke panjang maksimum.
  2. Hapus frasa injeksi, tag HTML, dan token peran LLM.
  3. Teruskan input tersanitasi ke pemrosesan downstream.

Guardrail output (Safety Classifier MD-AME)

  1. Evaluasi topik atau skrip terhadap safety_profile dimensi.
  2. Tulis hasil ke safety_audit_logs immutable.
  3. Tolak item jika classifier mengembalikan unsafe; pipeline skip atau HALT.

Guardrail koherensi (A2A Brainstorm)

  1. Hasilkan dokumen per-seksi.
  2. Jalankan audit koherensi di semua seksi.
  3. Terapkan micro-fix untuk kontradiksi.
  4. Validasi setiap perbaikan; revert jika validasi gagal.

Isolasi advisory (Polymarket)

  1. AI advisor menghasilkan rekomendasi read-only dengan struktur insight wajib.
  2. Jalur eksekusi tidak pernah menunggu respons advisor.
  3. Kegagalan advisor dicatat tetapi tidak memblokir trade.

Komponen Penting

KomponenTanggung jawab
Prompt FirewallSanitasi input sebelum panggilan LLM atau tulisan DB
Safety classifierEvaluasi output terhadap profil kebijakan
Audit koherensiDeteksi kontradiksi antar-seksi
Guardrail revertBatalkan micro-fix yang gagal validasi
Hard gateBlokir aksi downstream tanpa prasyarat valid
Lapisan advisorySaran saja — tanpa side effect eksekusi
Audit logTrail immutable keputusan keamanan

Contoh Implementasi yang Disederhanakan

Sanitasi input (disederhanakan):

# simplified — md-ame Prompt Firewall pattern
def sanitize_trend_input(raw: str) -> str:
text = truncate(raw, MAX_TREND_INPUT_LENGTH)
text = strip_html_tags(text)
text = remove_injection_phrases(text)
text = remove_role_tokens(text)
return text

Micro-fix terjaga dengan revert (disederhanakan):

// simplified — a2a-brainstormer coherence pattern
fix := proposeMicroFix(sections, contradiction)
patched := applyFix(sections, fix)
if !validateDocument(patched) {
return sections // revert — original preserved
}
return patched

Isolasi advisory (disederhanakan):

# simplified — polymarket pattern: advisor never blocks execution
try:
insight = ai_advisor.suggest(context) # read-only
log_advisory(insight)
except AdvisorError as e:
log_warning("advisor_unavailable", error=str(e))
# execution continues without advisor input

Keandalan dan Idempotensi

  • Default fail safe: MD-AME HALT pada kegagalan suara; polymarket memblokir tanpa probabilitas.
  • Audit log immutable: Keputusan keamanan append-only untuk tinjauan pasca-insiden.
  • Tanpa fallback diam-diam: API key hilang menonaktifkan agent, bukan beralih ke model lebih lemah secara diam-diam.
  • Cakupan perbaikan terbatas: Micro-fix koherensi adalah edit kecil, bukan regenerasi penuh.

Mode Kegagalan

KegagalanPerilaku
API classifier keamanan downTopik/skrip ditolak; dicatat ke audit
Perbaikan koherensi memperburuk keadaanRevert otomatis ke state pra-perbaikan
Percobaan prompt injectionDihapus firewall; dapat ditolak sepenuhnya
Timeout AI advisorEksekusi melanjutkan tanpa input advisory
Filter terlalu agresifPenolakan palsu dicatat; sesuaikan safety_profile per dimensi

Trade-off dan Alternatif yang Ditolak

PilihanAlasanAlternatif yang ditolak
Classifier per itemMenangkap konten tidak aman lebih awalMempercayai self-moderation LLM
Micro-fix bukan regenerasiMempertahankan konten baik; lebih murahRegenerasi seluruh dokumen
HALT pada kegagalan suaraKualitas di atas ketersediaanPublikasikan video tanpa audio
Isolasi advisoryKeandalan eksekusiLLM di jalur keputusan trade
Audit log immutableAkuntabilitasTimpa keputusan keamanan

Pengujian

  • A2A Brainstorm: coherence_test.go, aigen_test.go untuk jalur audit dan revert
  • MD-AME: Unit test dengan mock classifier; integration test untuk alur penolakan keamanan
  • Polymarket: Test memverifikasi eksekusi melanjutkan saat advisor gagal

Operasi dan Observabilitas

  • Tinjau safety_audit_logs untuk pola penolakan dan tingkat false positive
  • Pantau latensi API classifier — menambah 2 panggilan Gemini per video di MD-AME
  • Lacak ketersediaan advisor terpisah dari tingkat keberhasilan eksekusi

Pelajaran yang Dipetik

  1. Guardrail adalah arsitektur, bukan prompt — "tolong aman" di system prompt bukan guardrail.
  2. Revert sama pentingnya dengan perbaikan — selalu validasi dan batalkan koreksi yang gagal.
  3. Isolasi AI advisory — latensi dan kegagalan LLM tidak boleh memblokir critical path.
  4. Audit semuanya — keputusan keamanan membutuhkan log immutable untuk tuning dan compliance.

Terkait

Sumber