Setiap beberapa bulan, model baru memuncaki benchmark. Tergoda untuk mengejar leaderboard. Tapi model yang gue pakai tiap hari bukan yang terkuat di atas kertas. Itu yang cocok dengan bentuk kerja yang benar-benar gue lakukan.
Sebagian besar kerja gue adalah edit kecil di dalam codebase yang ada. Model yang cepat, murah, dan bagus dalam kelanjutan mengalahkan model yang brilian dalam trik pesta sekali tembak.
Apa yang membentuk pilihan gue
- Kecepatan loop edit
- Biaya sepanjang sesi panjang
- Kualitas kelanjutan, bukan hanya generasi
- Seberapa baik membaca struktur yang ada
Pilih model yang cocok dengan bentuk kerja lu. Benchmark mengukur sesuatu, tapi bukan hal yang paling penting di keyboard.


