Membangun AI Agent yang Aman: Tools, Guardrail, dan Persetujuan Manusia

Membangun AI Agent yang Aman: Tools, Guardrail, dan Persetujuan Manusia

AI agent bukan sekadar chatbot yang menghasilkan teks. Agent menerima tujuan, menyusun langkah, memakai tools, memeriksa hasil, lalu melanjutkan atau menghentikan pekerjaan sesuai kondisi. Pola ini membuka peluang besar untuk otomasi, tetapi juga membuat kesalahan kecil dapat berubah menjadi tindakan nyata pada sistem.

Bedakan model, workflow, dan agent

Model menghasilkan prediksi atau keputusan berdasarkan konteks. Workflow adalah urutan langkah yang sudah ditentukan. Agent berada di antara keduanya: model membantu mengatur eksekusi workflow dan memilih tool berdasarkan keadaan saat ini. Karena itu, desain agent perlu mendefinisikan batas tugas, data yang boleh diakses, serta kriteria selesai.

Mulai dari tools yang sempit

Tool sebaiknya memiliki kontrak input-output yang jelas. Misalnya, tool pencarian hanya membaca data dan mengembalikan hasil terstruktur, sedangkan tool pengiriman pesan atau perubahan database harus dipisahkan. Jangan memberikan akses shell, kredensial, atau endpoint administratif jika tugas dapat diselesaikan dengan fungsi yang lebih terbatas.

const tool = {
  name: 'get_invoice',
  inputSchema: { type: 'object', required: ['invoiceId'] },
  sideEffect: false,
  handler: async ({ invoiceId }) => invoiceRepository.findById(invoiceId)
}

Gunakan guardrail berlapis

  • Validasi input sebelum tool dipanggil.
  • Batasi resource, domain, ukuran file, dan durasi.
  • Filter output agar secret tidak masuk ke konteks atau log.
  • Gunakan idempotency key untuk operasi yang dapat mengubah data.
  • Catat alasan, tool, parameter yang aman ditampilkan, dan hasil setiap langkah.

Human-in-the-loop untuk tindakan berisiko

Penghapusan data, pembayaran, publikasi, perubahan izin, dan pengiriman pesan massal sebaiknya berhenti di tahap persetujuan. Preview harus menjelaskan target, perubahan, dampak, dan cara membatalkan. Persetujuan bukan formalitas: sistem harus mengikat approval pada payload yang benar-benar akan dieksekusi.

Evaluasi sebelum produksi

Uji agent dengan kasus normal, input ambigu, tool gagal, data kosong, respons berbahaya, dan percobaan keluar dari scope. Ukur keberhasilan tugas, jumlah tool call, waktu, biaya, serta tingkat eskalasi ke manusia. Log yang baik membantu menemukan apakah masalah berasal dari model, instruksi, tool, atau data.

Kesimpulan

Agent yang dapat dipercaya dibangun dari scope sempit, tool yang terisolasi, guardrail eksplisit, approval untuk mutasi, dan observability. Kemampuan model penting, tetapi kontrol eksekusi menentukan apakah otomasi aman digunakan dalam pekerjaan harian.

Sumber: OpenAI — A practical guide to building agents; OpenAI — Running Codex safely

Transparansi: Artikel ini disusun bersama Codekop AI berdasarkan sumber yang tercantum, lalu ditinjau dan disunting oleh Fauzan Falah. AI dapat keliru, jadi silakan cek kembali sumber asli.

Komentar