Skor DeepSeek V4 Pro Melonjak Tajam, Kimi K3 Tertinggal di Dua Benchmark Agen AI

DeepSeek V4 Pro mencatat kenaikan mencolok dibanding V4 Pro Preview, terutama pada pengujian rekayasa perangkat lunak. Skor DeepSWE melonjak dari 12,8 poin menjadi 62,7 poin, sementara hasil CyberGym naik dari 52,7 menjadi 83,3 poin.

Model baru itu juga meninggalkan Kimi K3 dalam dua benchmark agen AI yang dimuat DeepSeek. V4 Pro mengantongi 31,8 poin pada AutomationBench (Public) dan 67,2 poin pada DSBench-Hard.

Dalam pengujian yang sama, Kimi K3 memperoleh 30,8 poin pada AutomationBench (Public) serta 63,0 poin di DSBench-Hard. Data tersebut berasal dari benchmark yang dibagikan DeepSeek, sehingga hasilnya menggambarkan skenario uji perusahaan.

BenchmarkDeepSeek V4 ProV4 Pro PreviewKimi K3
Terminal-Bench 2.187,972,1
DeepSWE62,712,8
CyberGym83,352,7
Toolathlon-Verified74,155,9
AutomationBench (Public)31,830,8
DSBench-Hard67,263,0

Peningkatan lain terlihat pada Terminal-Bench 2.1, dari 72,1 poin pada V4 Pro Preview menjadi 87,9 poin pada V4 Pro. Toolathlon-Verified turut naik dari 55,9 poin menjadi 74,1 poin.

Dirancang untuk tugas berlapis

DeepSeek menempatkan V4 Pro sebagai model untuk pekerjaan agen AI yang kompleks. Agen AI dapat membantu menjalankan rangkaian pekerjaan dengan kemandirian lebih tinggi, dari tugas rutin hingga proses yang memerlukan penalaran panjang.

Kemampuan yang disorot mencakup pekerjaan melalui terminal, rekayasa perangkat lunak, keamanan siber, dan penggunaan alat secara kompleks. Fokus tersebut sejalan dengan jenis pengujian yang dipakai untuk mengukur peningkatan model.

V4 Pro dan V4 Flash menyediakan pengaturan reasoning effort dengan pilihan low, high, dan max. Pengaturan itu memberi pengguna pilihan tingkat penalaran sesuai kebutuhan pekerjaan.

Mode low ditujukan bagi tugas sederhana yang tidak membutuhkan proses berpikir panjang. Mode high disiapkan untuk pekerjaan agen AI sehari-hari, sedangkan max ditujukan bagi tugas yang lebih rumit.

DeepSeek juga menyebut V4 Pro mendukung API OpenAI Responses secara native. Dukungan tersebut dioptimalkan untuk digunakan bersama Codex dan tersedia melalui pengaturan satu klik untuk memudahkan integrasi.

Biaya API dan akses model

DeepSeek V4 Pro dapat diakses dari aplikasi dan situs web DeepSeek melalui opsi “Expert Mode”. Model ini juga tersedia lewat API tanpa mengharuskan pengguna mengganti nama model pada integrasi yang telah dibuat.

Mulai 16 Agustus 2026 pukul 23.00 WIB, tarif penggunaan dibedakan menjadi periode peak dan off-peak. Jam peak berlaku pukul 08.00-11.00 WIB dan 13.00-17.00 WIB, sedangkan tarif off-peak disebut 50 persen lebih murah.

ModelInput Cache HitInput Cache MissOutput
DeepSeek V4 Flash0,014 dollar AS0,44 dollar AS1,32 dollar AS
DeepSeek V4 Pro0,044 dollar AS1,32 dollar AS3,96 dollar AS

Nominal dalam tabel merupakan tarif peak per 1 juta token. Untuk V4 Pro, biaya output tercatat 3,96 dollar AS, sedangkan input cache hit dan cache miss masing-masing 0,044 dollar AS serta 1,32 dollar AS.

Baca Juga