1 artikel pakai tag LLM.
Riset terbaru nunjukin LLM judge lebih jago memverifikasi informasi yang ada daripada mendeteksi informasi yang hilang. Buat tim yang andalkan AI buat evaluasi, ini red flag yang harus dipahami.