Persaingan kecerdasan buatan tidak lagi hanya dikuasai perusahaan Amerika Serikat. Dua model asal Tiongkok, DeepSeek R1 dan Qwen 2.5, berhasil membuktikan bahwa model dengan bobot terbuka dapat menawarkan kemampuan yang kompetitif untuk penalaran, pemrograman, matematika, hingga pengembangan aplikasi berbasis AI.
Meski sering dibandingkan secara langsung, keduanya sebenarnya memiliki fokus yang berbeda. DeepSeek R1 dirancang sebagai model penalaran yang mengalokasikan lebih banyak proses komputasi untuk “memikirkan” jawaban. Sebaliknya, Qwen 2.5 merupakan keluarga model serbaguna yang tersedia dalam banyak ukuran dan dapat disesuaikan dengan kebutuhan perangkat maupun infrastruktur penggunanya.
Karena Qwen 2.5 bukan satu model tunggal, pembahasan ini menggunakan Qwen2.5-72B-Instruct sebagai pembanding utama. Model tersebut merupakan varian general-purpose dengan bobot terbuka paling besar dalam keluarga Qwen 2.5. Varian Qwen2.5-Coder dan Qwen2.5-Math akan dibahas secara terpisah ketika relevan.
Table of Contents
ToggleMengenal DeepSeek R1 dan Qwen 2.5
DeepSeek R1: AI yang Mengutamakan Penalaran
DeepSeek R1 adalah model penalaran yang dikembangkan oleh DeepSeek. Model ini dibangun di atas DeepSeek-V3-Base dan menggunakan arsitektur Mixture of Experts atau MoE. Secara keseluruhan, DeepSeek R1 memiliki 671 miliar parameter, tetapi hanya sekitar 37 miliar parameter yang diaktifkan untuk setiap token. Model ini mendukung panjang konteks hingga 128.000 token. Repositori resmi DeepSeek-R1
Pendekatan MoE memungkinkan model memiliki kapasitas yang sangat besar tanpa harus mengaktifkan seluruh parameter pada setiap proses inferensi. Akan tetapi, angka 37 miliar parameter aktif tidak berarti DeepSeek R1 dapat dijalankan semudah model dense berukuran 37 miliar parameter. Seluruh bobot model tetap harus disimpan dan didistribusikan di dalam sistem, sehingga versi penuh R1 membutuhkan infrastruktur kelas server.
Keunggulan utama DeepSeek R1 terletak pada kemampuannya melakukan penalaran bertahap. Model ini dikembangkan menggunakan kombinasi data awal berkualitas atau cold-start data, supervised fine-tuning, dan reinforcement learning. Strategi tersebut memperbaiki kekurangan DeepSeek-R1-Zero, seperti pengulangan jawaban, keterbacaan yang buruk, dan pencampuran bahasa.
Hasilnya adalah model yang sangat kuat untuk menyelesaikan soal matematika, sains, algoritma, dan pemrograman kompleks. Dalam evaluasi yang diterbitkan DeepSeek, R1 memperoleh skor 79,8 pada AIME 2024, 97,3 pada MATH-500, 71,5 pada GPQA Diamond, dan 65,9 pada LiveCodeBench. Pada SWE-bench Verified—pengujian penyelesaian masalah nyata dalam repositori perangkat lunak—R1 mencatatkan tingkat penyelesaian 49,2%. Hasil evaluasi resmi DeepSeek-R1
Angka-angka tersebut menunjukkan bahwa DeepSeek R1 bukan sekadar chatbot percakapan. Kekuatan terbesarnya muncul ketika model harus mengurai masalah, menguji beberapa kemungkinan, lalu memperbaiki langkah yang keliru sebelum menghasilkan jawaban akhir.
Qwen 2.5: Keluarga Model yang Fleksibel
Qwen 2.5 dikembangkan oleh tim Qwen dari Alibaba Cloud. Berbeda dengan DeepSeek R1 yang berfokus pada penalaran mendalam, Qwen 2.5 dirancang sebagai keluarga model serbaguna untuk pengetahuan umum, percakapan, pemrograman, matematika, penggunaan alat, pemrosesan data terstruktur, dan aplikasi multibahasa.
Keluarga Qwen 2.5 tersedia dalam ukuran 0,5B, 1,5B, 3B, 7B, 14B, 32B, dan 72B. Keragaman ini memungkinkan pengembang memilih model berdasarkan kebutuhan dan kemampuan perangkat. Model kecil dapat digunakan untuk eksperimen atau perangkat dengan sumber daya terbatas, sedangkan model 32B dan 72B lebih sesuai untuk server berkinerja tinggi. Blog resmi Qwen 2.5
Qwen2.5-72B menggunakan arsitektur dense, sehingga semua parameternya terlibat dalam pemrosesan. Model ini mempunyai sekitar 72,7 miliar parameter dan panjang konteks hingga 128.000 token, dengan kemampuan menghasilkan keluaran hingga sekitar 8.000 token.
Qwen 2.5 dilatih menggunakan data prapelatihan hingga 18 triliun token, meningkat dari sekitar 7 triliun token pada generasi sebelumnya. Tahap pascapelatihannya menggunakan lebih dari satu juta sampel supervised fine-tuning serta reinforcement learning bertingkat. Pengembangan tersebut ditujukan untuk meningkatkan pengetahuan, kemampuan mengikuti instruksi, analisis data terstruktur, dan kualitas teks panjang. Laporan teknis Qwen 2.5
Selain model umum, Alibaba menyediakan varian khusus:
- Qwen2.5-Coder, yang dioptimalkan untuk pemrograman dan dilatih menggunakan sekitar 5,5 triliun token data terkait kode.
- Qwen2.5-Math, yang berfokus pada matematika serta mendukung pendekatan Chain-of-Thought, Program-of-Thought, dan Tool-Integrated Reasoning.
- Varian instruction-tuned yang disiapkan untuk percakapan dan pelaksanaan instruksi.
Ekosistem yang luas inilah yang membuat Qwen 2.5 menarik bagi pengembang. Mereka tidak harus menggunakan model terbesar untuk setiap aplikasi.
Pertarungan Kemampuan
Penalaran dan Matematika
DeepSeek R1 unggul ketika persoalan menuntut penalaran panjang, eksplorasi beberapa strategi, atau koreksi mandiri. Skor 97,3 pada MATH-500 dan 79,8 pada AIME 2024 memperlihatkan kemampuannya dalam menghadapi persoalan matematika yang membutuhkan lebih dari sekadar mengingat pola jawaban.
Qwen2.5-72B-Instruct juga bukan model yang lemah dalam matematika. Model tersebut memperoleh skor 83,1 pada benchmark MATH dalam evaluasi resmi Qwen. Bahkan Qwen2.5-32B-Instruct mencatatkan skor MATH yang sama, sedangkan Qwen2.5-7B-Instruct mencapai 75,5. Hal ini memperlihatkan efisiensi yang baik pada varian Qwen berukuran lebih kecil. Evaluasi Qwen2.5-Instruct
Namun, hasil MATH dari Qwen tidak boleh disejajarkan begitu saja dengan skor MATH-500 milik DeepSeek. Walaupun kedua pengujian berasal dari domain matematika, kumpulan soal, konfigurasi prompt, metode sampling, dan metrik evaluasinya tidak selalu sama. Benchmark dari dua laporan resmi lebih tepat dibaca sebagai gambaran karakter masing-masing model, bukan perlombaan satu lawan satu dengan kondisi identik.
Secara praktis, DeepSeek R1 lebih cocok untuk pembuktian, soal kompetisi, analisis algoritma, dan masalah teknis dengan banyak tahapan. Qwen 2.5 lebih menarik ketika kemampuan matematika perlu digabungkan dengan percakapan umum, penyusunan dokumen, ekstraksi informasi, atau kebutuhan aplikasi lain.
Pemrograman dan Software Engineering
Pada pengujian resmi DeepSeek, R1 menghasilkan skor 65,9 pada LiveCodeBench dan rating 2.029 dalam evaluasi Codeforces. Model ini juga menyelesaikan 49,2% kasus pada SWE-bench Verified. Kemampuan tersebut membuatnya relevan untuk debugging, analisis algoritma, dan penyelesaian masalah kode yang kompleks.
Qwen2.5-72B-Instruct memperoleh skor 55,5 pada LiveCodeBench periode Mei 2023 sampai September 2024, 86,6 pada HumanEval, 88,2 pada MBPP, dan 75,1 pada MultiPL-E. Sementara itu, keluarga Qwen menyediakan Qwen2.5-Coder dalam beberapa ukuran untuk penggunaan yang lebih spesifik. Hasil resmi Qwen2.5-72B-Instruct
Sekali lagi, skor LiveCodeBench tersebut tidak sepenuhnya sebanding karena konfigurasi dan periode soal yang dilaporkan kedua pengembang berbeda. Meski demikian, kecenderungannya cukup jelas: DeepSeek R1 menonjol pada pemecahan masalah yang membutuhkan penalaran panjang, sedangkan Qwen 2.5 menawarkan ekosistem model coding yang lebih fleksibel untuk berbagai skala perangkat keras.
Bagi seorang software engineer, pilihan ideal bergantung pada pekerjaan yang dilakukan. DeepSeek R1 menarik untuk menganalisis bug rumit, merancang algoritma, atau memahami basis kode. Qwen2.5-Coder dapat lebih praktis untuk penyelesaian kode, pembuatan fungsi, refactoring, dan asisten pemrograman lokal.
Pengetahuan Umum dan Kepatuhan terhadap Instruksi
Qwen2.5-72B-Instruct menunjukkan kemampuan yang kuat pada tugas general-purpose. Dalam laporan Qwen, model ini memperoleh skor 71,1 pada MMLU-Pro, 86,8 pada MMLU-Redux, 84,1 pada IFEval, dan 9,35 pada MT-Bench.
Qwen juga dirancang agar mampu menangani system prompt, permainan peran, data berbentuk tabel, serta keluaran terstruktur seperti JSON. Karakteristik tersebut penting dalam pembuatan chatbot, AI agent, layanan pelanggan, ekstraksi data, dan integrasi model ke aplikasi bisnis.
DeepSeek R1 sebenarnya mencatatkan skor MMLU-Pro yang lebih tinggi, yaitu 84,0, dalam evaluasi internalnya. Namun, skor IFEval-nya berada di angka 83,3 dan dokumentasi resminya menyarankan pengguna untuk tidak menambahkan system prompt. Seluruh instruksi dianjurkan ditempatkan di dalam user prompt. Rekomendasi ini menunjukkan bahwa R1 mempunyai pola penggunaan yang lebih khusus dibandingkan model percakapan serbaguna.
Dengan kata lain, DeepSeek R1 dapat menguasai soal pengetahuan yang sulit, tetapi Qwen 2.5 cenderung lebih mudah diintegrasikan ke aplikasi yang membutuhkan kontrol perilaku, format keluaran konsisten, dan pengaturan persona.
Dukungan Multibahasa, Termasuk Bahasa Indonesia
Qwen 2.5 dikembangkan dengan perhatian besar pada kemampuan multibahasa. Tim Qwen secara khusus menguji modelnya menggunakan berbagai benchmark berbahasa Arab, Jepang, Korea, Turki, dan Indonesia.
Dalam IndoMMLU, Qwen2.5-72B-Instruct memperoleh skor 69,25. Model yang sama juga mencatatkan 86,98 pada IFEval multibahasa, yang menguji kemampuannya mengikuti instruksi dalam delapan bahasa, termasuk bahasa Indonesia. Evaluasi multibahasa Qwen 2.5
DeepSeek R1 juga dapat digunakan dalam berbagai bahasa, tetapi model ini dapat menghasilkan jawaban yang sangat panjang atau sesekali mencampurkan bahasa, terutama pada proses penalarannya. Untuk aplikasi berbahasa Indonesia yang membutuhkan gaya komunikasi stabil dan format terstruktur, Qwen 2.5 umumnya menjadi pilihan yang lebih praktis. Untuk tugas berbahasa Indonesia yang sangat bergantung pada logika, R1 tetap layak dipertimbangkan selama hasilnya diverifikasi.
Efisiensi dan Kemudahan Menjalankan Model
Model Penuh Tidak Sama dengan Model Distilasi
Salah satu kekeliruan yang sering muncul adalah menganggap DeepSeek-R1-Distill-Qwen-32B sebagai DeepSeek R1 versi penuh yang sekadar diperkecil. Keduanya bukan model yang sama.
DeepSeek R1 penuh adalah model MoE dengan total 671 miliar parameter. Sementara itu, DeepSeek-R1-Distill-Qwen-32B menggunakan Qwen2.5-32B sebagai model dasar, kemudian dilatih menggunakan data keluaran yang dihasilkan R1. DeepSeek merilis enam model distilasi berukuran 1,5B, 7B, 8B, 14B, 32B, dan 70B yang berbasis Qwen maupun Llama.
Menariknya, hubungan kedua kubu tidak sepenuhnya bersifat persaingan. Teknologi Qwen justru menjadi fondasi bagi empat model distilasi DeepSeek R1. DeepSeek-R1-Distill-Qwen-32B, misalnya, mencatatkan skor 72,6 pada AIME 2024 dan 94,3 pada MATH-500 menurut evaluasi DeepSeek. Ini memperlihatkan bagaimana ekosistem AI terbuka berkembang melalui proses saling memanfaatkan inovasi.
Kebutuhan Perangkat Keras
DeepSeek R1 versi penuh membutuhkan penyimpanan dan memori yang sangat besar. Walaupun hanya sekitar 37 miliar parameter yang aktif untuk setiap token, keseluruhan 671 miliar parameter tetap harus tersedia di sistem. Pengguna rumahan umumnya akan lebih realistis menjalankan salah satu versi distilasinya.
Qwen 2.5 menawarkan jalur implementasi yang lebih fleksibel. Model 0,5B sampai 7B dapat digunakan untuk eksperimen ringan, sedangkan varian 14B atau 32B dapat menjadi titik tengah antara performa dan kebutuhan komputasi. Qwen2.5-72B tetap memerlukan server atau beberapa GPU berkapasitas besar, terutama jika dijalankan tanpa kuantisasi.
Karena itu, Qwen 2.5 lebih unggul dari sisi pilihan skala. DeepSeek R1 unggul pada kemampuan maksimum, tetapi Qwen memungkinkan pengembang memilih model yang sesuai dengan anggaran dan perangkatnya.
Benarkah Keduanya Sepenuhnya Open-Source?
Istilah “open-source AI” perlu digunakan secara hati-hati. Dalam pengembangan perangkat lunak, open-source biasanya berarti kode sumber tersedia dengan lisensi yang memenuhi definisi tertentu. Pada model AI, yang dibuka dapat berupa bobot model, kode inferensi, laporan teknis, atau sebagian informasi pelatihan—tetapi belum tentu seluruh dataset dan proses pembuatannya dapat direproduksi.
DeepSeek merilis bobot R1 dan kode terkait di bawah lisensi MIT, dengan ketentuan lisensi model yang mengizinkan penggunaan komersial, modifikasi, dan pembuatan model turunan. Karena keterbukaan dan kelonggaran lisensinya, DeepSeek R1 relatif ramah bagi penelitian maupun pengembangan produk.
Qwen 2.5 memiliki lisensi berbeda berdasarkan ukuran model. Varian 0,5B, 1,5B, 7B, 14B, dan 32B menggunakan Apache 2.0. Namun, Qwen2.5-3B menggunakan Qwen Research License, sedangkan Qwen2.5-72B memakai Qwen License. Oleh sebab itu, pengguna harus memeriksa lisensi varian yang akan digunakan dan tidak menganggap seluruh keluarga Qwen memiliki ketentuan yang sama.
Istilah open-weight pada akhirnya lebih akurat untuk menggambarkan keduanya. Bobot model dapat diunduh dan dijalankan sendiri, tetapi seluruh data pelatihan dan pipeline produksinya tidak dibuka secara lengkap.
Jadi, Siapa yang Layak Menjadi Raja?
Tidak ada satu pemenang mutlak karena DeepSeek R1 dan Qwen 2.5 dirancang untuk prioritas berbeda. Perbandingan ringkasnya adalah sebagai berikut:
| Aspek | DeepSeek R1 | Qwen2.5-72B-Instruct | Lebih unggul |
|---|---|---|---|
| Fokus utama | Penalaran mendalam | Model serbaguna | Bergantung kebutuhan |
| Arsitektur | MoE, 671B total dan sekitar 37B aktif | Dense, sekitar 72,7B | — |
| Panjang konteks | 128K token | 128K token | Seimbang |
| Matematika dan logika kompleks | Sangat kuat | Kuat | DeepSeek R1 |
| Pemrograman berbasis penalaran | Sangat kuat | Kuat | DeepSeek R1 |
| Model coding khusus | Mengandalkan R1 dan model distilasi | Memiliki keluarga Qwen2.5-Coder | Qwen 2.5 |
| Percakapan dan instruksi umum | Baik, tetapi pola penggunaan lebih khusus | Sangat baik dan mudah dikendalikan | Qwen 2.5 |
| Keluaran terstruktur dan system prompt | Lebih terbatas; dokumentasi menyarankan tanpa system prompt | Kuat untuk JSON, tabel, dan system prompt | Qwen 2.5 |
| Pilihan ukuran | R1 penuh serta distilasi 1,5B–70B | Model native 0,5B–72B | Qwen 2.5 |
| Kemudahan dijalankan secara lokal | Versi penuh sangat berat; distilasi lebih realistis | Banyak pilihan untuk berbagai perangkat | Qwen 2.5 |
| Lisensi | R1 dirilis dengan lisensi MIT | Berbeda menurut ukuran; mayoritas Apache 2.0, tetapi 3B dan 72B memakai lisensi khusus | DeepSeek R1 untuk kesederhanaan lisensi |
| Pengguna ideal | Peneliti, engineer, dan aplikasi reasoning | Developer aplikasi, chatbot, agent, dan deployment fleksibel | Bergantung kebutuhan |
Jika “raja” didefinisikan sebagai model dengan kemampuan penalaran paling kuat, DeepSeek R1 lebih layak mendapatkan gelar tersebut. Model ini unggul untuk matematika tingkat lanjut, algoritma, debugging kompleks, dan tugas yang memerlukan proses berpikir panjang.
Namun, jika gelar itu diberikan kepada ekosistem yang paling fleksibel dan mudah digunakan, Qwen 2.5 menjadi pemenangnya. Pilihan ukuran yang lengkap, kemampuan multibahasa, dukungan terhadap system prompt, keluaran terstruktur, serta varian khusus coding dan matematika membuatnya lebih mudah diterapkan dalam berbagai produk.
Kesimpulan paling adil adalah: DeepSeek R1 merupakan raja penalaran, sedangkan Qwen 2.5 merupakan raja fleksibilitas. Untuk pengguna dengan infrastruktur besar dan kebutuhan analisis kompleks, DeepSeek R1 menawarkan kemampuan yang lebih agresif. Untuk mahasiswa, pengembang individu, startup, atau perusahaan yang membutuhkan model dengan banyak pilihan ukuran, Qwen 2.5 sering menjadi keputusan yang lebih rasional.
Pada akhirnya, model AI terbaik bukanlah model dengan angka benchmark paling tinggi, melainkan model yang paling sesuai dengan jenis tugas, perangkat keras, lisensi, biaya operasional, dan standar kualitas aplikasi yang sedang dibangun.
