Amir Rudin
LLM & Code EvaluationID: #claude-code

AI Evaluation & Model Comparison (Claude Code)

Mengevaluasi dan membandingkan iterasi Tier-1 LLMs di lingkungan Claude Code menggunakan alur kerja agen multi-putaran. Menguji logika pengkodean, mengidentifikasi halusinasi edge-case, dan menulis justifikasi alasan verifikasi RLHF langkah-demi-langkah yang ketat.

Galeri Tangkapan Layar (Klik untuk Memperbesar)
0 Gambar
No screenshots uploaded for this project.

🔒 Status Kepatuhan: Disetujui (NDA)

Seluruh merek dagang klien dan dataset spesifik dilindungi sesuai ketentuan NDA.

Metodologi Evaluasi:

1Alur Kerja Agen Multi-Putaran

Melakukan percakapan ekstensif dan tugas agen dengan model LLM di lingkungan Claude Code untuk menguji batas kemampuan pengkodean.

2Perbandingan Model Berdampingan

Membandingkan respons model untuk mengidentifikasi edge-case, halusinasi, dan cacat logika dalam kode yang dihasilkan.

3Justifikasi RLHF Ketat

Menulis alasan langkah-demi-langkah yang ketat untuk menjustifikasi model mana yang lebih unggul berdasarkan metrik holistik.

4Peningkatan Model

Berkontribusi pada perbaikan langsung model frontier AI melalui umpan balik manusia berkualitas tinggi.

Teknologi & Alat yang Digunakan

Claude CodeTier-1 LLMsRLHFModel Comparison