Kısa yanıt: AI ajanı üretime alınmadan önce ne test edilir?
Temsil gücü olan bir değerlendirme veri seti hazırlanır; görev başarısı, kaynak doğruluğu, araç çağrısı, yetki sınırı, zararlı girdi dayanıklılığı, belirsizlik davranışı, insan onayı, gecikme ve maliyet ölçülür. Hatalı veya düşük güvenli durumda ajanın durması, güvenli alternatife dönmesi ve olayı kaydetmesi doğrulanır. Yayından sonra model, istem ve veri değişimleri aynı metriklerle sürekli izlenir.
- Görev ve alt adım başarı oranı
- Kaynak desteği ve veri güncelliği
- Doğru araç, doğru parametre ve doğru yetki
- Prompt injection ve veri sızıntısı dayanıklılığı
- İnsan onayı ve güvenli geri dönüş
- Gecikme, token maliyeti ve hata bütçesi
1. Başarıyı göreve göre tanımlayın
Genel 'iyi cevap' değerlendirmesi üretim kararı için yeterli değildir. Ajanın gerçekleştirdiği her görev için beklenen sonuç, izin verilen araçlar, yasak eylemler, gerekli kaynaklar ve kabul eşiği yazılmalıdır.
Test seti yalnızca ideal örneklerden oluşmamalıdır. Eksik bilgi, çelişkili kayıt, yetkisiz istek, sıra dışı format, dış sistem hatası ve kötü niyetli talep gibi gerçek operasyon koşulları temsil edilmelidir.
2. Çıktıyı ve dayanağını ayrı ölçün
Yanıtın akıcı görünmesi doğru olduğu anlamına gelmez. Bilginin verilen kurumsal kaynağa dayanıp dayanmadığı, doğru kayda bağlanıp bağlanmadığı ve belirsiz durumda kesin ifade üretip üretmediği ayrı metriklerle değerlendirilmelidir.
- Alan veya iddia bazında doğruluk
- Kaynak gösterme ve kaynakla tutarlılık
- Eksik bilgi durumunda açıklama isteme
- Bilmediğinde durma veya insan desteğine yönlendirme
- Hassas ve kişisel veriyi maskeleme
3. Araç çağrılarını işlem düzeyinde test edin
Bir ajan CRM kaydı oluşturuyor, e-posta gönderiyor veya belgeyi sisteme işliyorsa yalnızca son metin değil bütün eylem zinciri doğrulanmalıdır. Doğru aracın seçilmesi, parametrelerin şemaya uyması, yetkinin kontrol edilmesi ve tekrar denemede aynı işlemin iki kez oluşmaması gerekir.
- Araç izin listesi ve en az ayrıcalık
- Şema ve iş kuralı doğrulaması
- Okuma ve yazma eylemlerinin ayrılması
- İdempotans, zaman aşımı ve tekrar deneme
- Yüksek etkili işlem öncesi insan onayı
- Her adım için denetim kaydı
4. Kötü niyetli ve beklenmedik girdileri sınayın
Prompt injection, talimat çakışması, gizli sistem bilgisini isteme, yetki atlatma ve zararlı dosya içeriği ayrı saldırı senaryolarıdır. Test yalnızca sohbet kutusunu değil; ajanın okuduğu belge, web sayfası, e-posta ve araç çıktısı gibi dolaylı girdileri de kapsamalıdır.
Koruma tek bir filtreye dayanmaz. Veri erişim sınırı, araç yetkisi, içerik doğrulama, model talimatı, insan onayı ve olay alarmı katmanlı biçimde uygulanmalıdır.
5. İnsan denetimi ve güvenli geri dönüş tasarlayın
Yüksek maliyetli, geri alınamaz, hukuki veya kişisel veri etkisi olan işlemler otomatik varsayılmamalıdır. Ajan düşük güven, politika ihlali, dış sistem hatası veya kapsam dışı istek gördüğünde işlemi durdurmalı ve gerekli bağlamla yetkili kullanıcıya aktarmalıdır.
- Onay gerektiren işlem sınıfları
- Güven ve risk eşikleri
- Kullanıcıya anlaşılır hata açıklaması
- Manuel işleme aktarılacak bağlam
- İptal ve geri alma mekanizması
6. Üretimde aynı ölçümü sürdürün
NIST AI RMF, test, değerlendirme, doğrulama ve geçerleme süreçlerinin belgelenmesini; kullanılan modellerin düzenli izleme ve bakım kapsamında takip edilmesini önerir. Model, istem, bilgi tabanı veya araç değiştiğinde temel değerlendirme seti yeniden çalıştırılmalıdır.
Canlı izleme görev başarısı, kullanıcı düzeltmesi, güvenli geri dönüş, gecikme, maliyet, araç hatası ve güvenlik alarmını birlikte göstermelidir. Yeni hata örnekleri kişisel veriden arındırılarak değerlendirme setine eklenir.
Üretime geçiş kararı
Karar tek bir ortalama skora bağlanmamalıdır. Kritik güvenlik senaryolarında sıfır tolerans, iş görevlerinde kabul eşiği, maliyet ve gecikmede operasyon bütçesi tanımlanır. Kalan risklerin sahibi, izleme ekranı, kapatma anahtarı ve olay müdahale sorumlusu belirlenmeden ajan tam otomasyona geçirilmemelidir.
Kaynaklar ve standartlar
Bu rehber aşağıdaki birincil standart ve çerçeveler temel alınarak Maestro Dev'in uygulama yaklaşımıyla hazırlanmıştır.