Menjalankan model kecerdasan buatan di perangkat atau server sendiri kini semakin mudah. Dua nama yang paling sering muncul dalam pembahasan ini adalah Ollama dan vLLM. Keduanya dapat menjalankan Large Language Model (LLM) tanpa bergantung sepenuhnya pada layanan AI komersial, tetapi keduanya dirancang untuk kebutuhan yang berbeda.
Ollama menonjol karena menawarkan pengalaman penggunaan yang praktis pada laptop atau PC. Pengguna dapat mengunduh dan menjalankan model hanya melalui beberapa perintah sederhana. Sebaliknya, vLLM dirancang sebagai mesin inferensi berperforma tinggi yang mampu melayani banyak permintaan secara bersamaan.
Karena itu, pertanyaan “mana yang paling kencang?” tidak dapat dijawab hanya dengan membandingkan jumlah token per detik. Kita juga harus melihat jumlah pengguna, perangkat keras, format model, penggunaan memori, latensi, serta kompleksitas pengelolaannya.
Table of Contents
ToggleMemahami Perbedaan Dasar Ollama dan vLLM
Apa Itu Ollama?
Ollama adalah platform untuk mengunduh, mengelola, dan menjalankan model AI secara lokal. Platform ini menyediakan antarmuka command-line, REST API, serta kompatibilitas dengan sebagian API OpenAI.
Salah satu daya tarik utama Ollama adalah kesederhanaannya. Pengguna dapat menjalankan model dengan perintah seperti:
ollama run llama3.2
Ollama akan menangani proses pengunduhan model, konfigurasi dasar, penyimpanan model, dan eksekusi inferensi. Pendekatan ini membuatnya cocok bagi mahasiswa, software engineer, peneliti, dan pengguna pribadi yang ingin bereksperimen tanpa harus membangun lingkungan AI yang kompleks.
Pada lapisan inferensi lokalnya, Ollama mengintegrasikan teknologi dari llama.cpp. Dokumentasi repositorinya menunjukkan bahwa Ollama menggunakan versi llama.cpp tertentu beserta lapisan kompatibilitas untuk model-model GGUF yang telah diterbitkan. Format GGUF dan kuantisasi memungkinkan model diperkecil sehingga lebih realistis dijalankan pada RAM, CPU, Apple Silicon, ataupun GPU kelas konsumen. Repositori Ollama dan dokumentasi integrasi llama.cpp menjelaskan hubungan teknis tersebut.
Apa Itu vLLM?
vLLM adalah mesin inferensi dan serving LLM yang berorientasi pada performa tinggi. Perangkat lunak ini lebih sering digunakan sebagai backend API untuk aplikasi AI, server internal perusahaan, dan layanan yang harus menangani banyak permintaan dalam waktu bersamaan.
vLLM menawarkan sejumlah fitur untuk meningkatkan pemanfaatan perangkat keras, antara lain:
- PagedAttention untuk pengelolaan memori Key-Value Cache;
- continuous batching untuk menggabungkan permintaan yang masuk;
- prefix caching dan chunked prefill;
- tensor, pipeline, data, expert, dan context parallelism;
- dukungan berbagai metode kuantisasi;
- API yang kompatibel dengan OpenAI;
- streaming dan distributed inference.
Fitur-fitur tersebut tercantum dalam dokumentasi resmi vLLM.
Berbeda dari anggapan bahwa vLLM hanya dapat menjalankan model FP16, BF16, AWQ, dan GPTQ, versi terkininya juga mendukung format atau metode lain, termasuk GGUF, INT4, INT8, FP8, bitsandbytes, compressed-tensors, dan beberapa format kuantisasi khusus perangkat keras. Tingkat dukungannya tetap bergantung pada GPU, arsitektur model, dan metode kuantisasi yang digunakan.
Arti “Paling Kencang” dalam Inferensi AI
Kecepatan sebuah mesin inferensi tidak hanya mempunyai satu ukuran. Setidaknya terdapat tiga metrik yang perlu diperhatikan.
Throughput
Throughput menunjukkan jumlah token yang dapat dihasilkan sistem dalam suatu periode, biasanya ditulis sebagai token per detik. Pada server dengan banyak permintaan bersamaan, throughput sering dihitung sebagai total token dari seluruh pengguna.
vLLM umumnya lebih unggul dalam skenario ini. Mesin tersebut dirancang agar GPU tidak banyak menganggur ketika terdapat banyak permintaan dengan panjang prompt dan keluaran yang berbeda-beda.
Namun, angka throughput tidak dapat dibandingkan secara adil apabila model, kuantisasi, panjang konteks, batch, GPU, dan parameter pengujiannya berbeda. Oleh sebab itu, klaim seperti “Ollama menghasilkan 41 token per detik sedangkan vLLM menghasilkan 700 token per detik” tidak boleh dianggap sebagai hasil universal. Angka semacam itu hanya berlaku untuk konfigurasi pengujian tertentu.
Time to First Token
Time to First Token atau TTFT adalah waktu sejak permintaan dikirim sampai token pertama diterima pengguna. Metrik ini sangat memengaruhi kesan responsif dalam aplikasi percakapan.
Pada penggunaan pribadi dengan satu permintaan, Ollama dapat terasa sangat responsif, terutama ketika model sudah tersimpan di memori. Ollama secara bawaan mempertahankan model di memori selama beberapa menit dan menyediakan pengaturan keep_alive agar model tidak perlu dimuat ulang pada setiap permintaan.
Sementara itu, keunggulan vLLM biasanya semakin terlihat ketika jumlah permintaan meningkat. Penjadwalan dan pengelolaan cache yang efisien membantu sistem menjaga latensi di tengah beban paralel. Akan tetapi, TTFT tetap dapat meningkat jika GPU kehabisan kapasitas, antrean terlalu panjang, prompt sangat besar, atau konfigurasi serving tidak sesuai.
Inter-Token Latency
Inter-token latency adalah jeda waktu antara satu token keluaran dan token berikutnya. Metrik ini menggambarkan seberapa lancar teks muncul setelah proses generasi dimulai.
Untuk satu pengguna, perbedaannya dapat relatif kecil apabila Ollama dan vLLM menjalankan model, presisi, serta perangkat keras yang setara. Pada beban tinggi, vLLM mempunyai mekanisme penjadwalan yang lebih sesuai untuk mempertahankan performa agregat.
Mengapa vLLM Unggul Saat Melayani Banyak Pengguna?
PagedAttention dan Pengelolaan KV Cache
Ketika sebuah LLM memproses percakapan, sistem menyimpan informasi Key-Value atau KV dari token-token sebelumnya. Penyimpanan tersebut disebut KV cache. Semakin panjang konteks dan semakin banyak pengguna, semakin besar memori yang dibutuhkan.
Masalahnya, panjang setiap permintaan tidak selalu sama. Alokasi memori yang terlalu kaku dapat menyebabkan sebagian VRAM terbuang atau terfragmentasi.
PagedAttention pada vLLM membagi KV cache menjadi blok-blok memori yang dapat dikelola secara lebih fleksibel—konsepnya menyerupai paging pada sistem operasi. Hasilnya, vLLM dapat menggunakan memori secara lebih efisien dan menampung lebih banyak sequence secara bersamaan. Dokumentasi vLLM menyebut PagedAttention sebagai salah satu teknologi utama untuk pengelolaan memori key dan value pada attention.
Continuous Batching
Batching konvensional dapat membuat satu kelompok permintaan menunggu sampai seluruh anggota batch selesai. Masalah muncul ketika keluaran pengguna pertama hanya 50 token, sedangkan pengguna kedua meminta 1.000 token.
Continuous batching memungkinkan scheduler memasukkan permintaan baru ketika slot pemrosesan tersedia, tanpa harus menunggu seluruh batch lama selesai. Dengan demikian, GPU dapat terus digunakan secara efektif walaupun permintaan datang dan selesai pada waktu yang berbeda-beda.
Kombinasi continuous batching, chunked prefill, dan pengelolaan KV cache membuat vLLM sangat kuat untuk chatbot perusahaan, API publik, layanan inference-as-a-service, atau aplikasi yang digunakan banyak orang.
Skalabilitas ke Beberapa GPU
vLLM mendukung beberapa jenis parallelism untuk mendistribusikan model dan beban kerja. Fitur ini penting ketika satu model terlalu besar untuk sebuah GPU atau ketika kapasitas sebuah GPU tidak lagi mencukupi jumlah permintaan.
Kemampuan tersebut membuat vLLM lebih cocok untuk deployment yang berkembang dari satu GPU menjadi beberapa GPU atau beberapa node. Sebaliknya, Ollama lebih berorientasi pada pengalaman menjalankan model secara praktis, meskipun Ollama juga dapat memanfaatkan beberapa GPU apabila sebuah model tidak muat pada satu GPU.
Mengapa Ollama Lebih Menarik untuk Penggunaan Personal?
Instalasi dan Pengoperasian Lebih Sederhana
Ollama menyederhanakan banyak pekerjaan teknis, mulai dari pengunduhan model sampai penyediaan API lokal. Pengguna tidak harus mengatur lingkungan Python, memilih versi PyTorch, mencocokkan toolkit CUDA, atau memahami parameter serving sejak awal.
Hal ini memberikan keunggulan berupa time to productivity. Walaupun vLLM mungkin mempunyai throughput lebih besar di server, Ollama sering menjadi solusi yang lebih cepat untuk benar-benar mulai bekerja.
Ollama cocok untuk:
- coding assistant pribadi;
- eksperimen model;
- prototipe aplikasi;
- chatbot offline;
- pembelajaran AI;
- pembuatan ringkasan dokumen lokal;
- aplikasi Retrieval-Augmented Generation skala kecil.
Dukungan Sistem Operasi yang Lebih Ramah Pengguna
Ollama tersedia untuk macOS, Windows, dan Linux. Dukungan perangkat kerasnya mencakup sejumlah GPU NVIDIA dan AMD, Apple Silicon melalui Metal, serta pemrosesan berbasis CPU. Daftar kompatibilitas terbarunya tersedia dalam dokumentasi perangkat keras Ollama.
Untuk vLLM, lingkungan utama yang didukung secara resmi masih berorientasi pada Linux. Dokumentasinya menyatakan bahwa Windows belum didukung secara native. Pengguna Windows dapat menjalankannya melalui WSL atau memakai fork yang dipelihara komunitas. Persyaratan ini membuat vLLM kurang praktis untuk sebagian pengguna desktop. Panduan instalasi GPU vLLM menjelaskan persyaratan tersebut.
Model Terkuantisasi dan Perangkat Keras Konsumen
Ollama sangat nyaman digunakan dengan model GGUF terkuantisasi. Model 4-bit atau 8-bit membutuhkan memori lebih kecil daripada model berpresisi tinggi, meskipun kuantisasi dapat menurunkan kualitas keluaran pada tingkat tertentu.
Dengan pendekatan ini, pengguna dapat menjalankan model pada laptop atau PC yang sebelumnya tidak dianggap memadai untuk LLM. Sebagian layer juga dapat ditempatkan pada GPU dan sisanya pada RAM, walaupun konfigurasi yang seluruh modelnya masuk ke VRAM biasanya memberikan performa lebih baik.
Ollama Juga Mendukung Permintaan Paralel
Salah satu informasi yang perlu diluruskan dari materi awal adalah anggapan bahwa Ollama selalu memproses permintaan secara berurutan.
Ollama sebenarnya mendukung dua tingkat konkurensi:
- beberapa model dapat dimuat secara bersamaan jika memori mencukupi; dan
- sebuah model dapat memproses beberapa permintaan secara paralel jika kapasitas memori memungkinkan.
Konfigurasi tersebut dapat diatur melalui OLLAMA_MAX_LOADED_MODELS, OLLAMA_NUM_PARALLEL, dan OLLAMA_MAX_QUEUE. Nilai bawaan OLLAMA_NUM_PARALLEL adalah satu, sedangkan permintaan berikutnya dapat dimasukkan ke antrean ketika kapasitas tidak mencukupi.
Pemrosesan paralel juga meningkatkan kebutuhan memori. Dokumentasi Ollama menjelaskan bahwa kebutuhan RAM kira-kira bertambah mengikuti jumlah permintaan paralel dikalikan panjang konteks. Penjelasan lengkapnya tersedia pada FAQ resmi Ollama.
Dengan demikian, pernyataan yang lebih akurat bukan “Ollama tidak mendukung concurrency,” tetapi Ollama memiliki concurrency yang lebih sederhana dan sangat bergantung pada kapasitas memori, sedangkan vLLM sejak awal dioptimalkan untuk serving dengan throughput tinggi.
Perbandingan Format Model dan Kompatibilitas
Ollama dan GGUF
GGUF menjadi format yang sangat erat dengan pengalaman penggunaan Ollama. Format tersebut menyediakan metadata dan tensor model dalam satu berkas serta mendukung berbagai tingkat kuantisasi.
Pengguna juga dapat membuat model khusus melalui Modelfile, mengimpor model yang kompatibel, mengatur system prompt, menentukan parameter, serta menambahkan adapter tertentu.
vLLM dan Ekosistem Hugging Face
vLLM terintegrasi erat dengan model-model dari Hugging Face. Ia mendukung banyak arsitektur model sekaligus berbagai metode kuantisasi seperti AWQ, GPTQ, INT4, INT8, FP8, bitsandbytes, dan GGUF.
Meskipun demikian, tersedianya sebuah format tidak selalu berarti performanya optimal pada seluruh perangkat. Dukungan kernel, arsitektur GPU, tipe kuantisasi, dan model tetap harus diperiksa sebelum deployment. Daftar kompatibilitasnya dapat dilihat melalui dokumentasi kuantisasi vLLM.
Kebutuhan Perangkat Keras
Ollama
Ollama dapat berjalan hanya dengan CPU, meskipun proses generasi biasanya lebih lambat. Pengguna dapat memanfaatkan GPU konsumen atau Apple Silicon untuk memperoleh performa yang lebih baik.
Karena model terkuantisasi tersedia dalam banyak ukuran, kebutuhan perangkat keras dapat disesuaikan dengan kemampuan komputer. Akan tetapi, model yang lebih besar, konteks yang lebih panjang, dan permintaan paralel tetap membutuhkan RAM atau VRAM lebih banyak.
vLLM
vLLM bukan hanya untuk GPU enterprise. Dokumentasinya juga mencantumkan dukungan GPU konsumen yang memenuhi persyaratan arsitektur tertentu, selain NVIDIA, AMD, Intel, CPU, dan plugin perangkat keras lainnya.
Namun, manfaat utama vLLM lebih mudah terlihat pada GPU dengan kapasitas dan bandwidth memori tinggi. Deployment produksi juga biasanya memerlukan Linux, lingkungan container, monitoring, pengaturan antrean, serta pemahaman mengenai utilisasi GPU.
Jadi, RTX 4090 bukan syarat minimum universal, sedangkan A100 atau H100 bukan satu-satunya pilihan. Kebutuhan sebenarnya harus ditentukan berdasarkan ukuran model, presisi, panjang konteks, jumlah permintaan paralel, dan target latensi.
Kemudahan Integrasi
Keduanya dapat digunakan sebagai backend aplikasi dan sama-sama menyediakan jalur kompatibilitas dengan API OpenAI.
Ollama sangat praktis untuk aplikasi lokal. Endpoint-nya sederhana dan banyak aplikasi pihak ketiga dapat terhubung langsung. Dokumentasi OpenAI Compatibility Ollama menyediakan contoh penggunaan endpoint yang kompatibel.
vLLM menyediakan server kompatibel OpenAI yang lebih diarahkan pada serving produksi. Ia juga menawarkan kemampuan seperti distributed inference, multi-LoRA, structured output, tool calling, serta beragam strategi parallelism.
Dengan kata lain, Ollama unggul dalam pengalaman developer lokal, sementara vLLM lebih kuat sebagai inference backend yang dapat ditingkatkan skalanya.
Biaya yang Perlu Diperhitungkan
Ollama menggunakan lisensi MIT, sedangkan vLLM menggunakan lisensi Apache 2.0. Keduanya dapat digunakan tanpa membayar lisensi perangkat lunak, termasuk untuk banyak skenario komersial, selama pengguna mematuhi ketentuan lisensinya. Lisensi model yang dijalankan harus diperiksa secara terpisah karena tidak otomatis mengikuti lisensi mesin inferensinya.
Walaupun perangkat lunaknya gratis, menjalankan AI lokal tetap memiliki biaya, seperti:
- pembelian atau penyewaan GPU;
- konsumsi listrik;
- RAM dan media penyimpanan;
- pendinginan;
- bandwidth;
- pemeliharaan server;
- tenaga DevOps dan observability.
Ollama dapat nyaris tidak memerlukan investasi tambahan apabila dijalankan pada komputer yang sudah dimiliki. Sebaliknya, deployment vLLM untuk banyak pengguna mungkin membutuhkan GPU server atau cloud. Namun, tidak ada estimasi biaya cloud yang berlaku secara universal karena harga berubah menurut penyedia, wilayah, GPU, kontrak, dan durasi pemakaian.
Cara Membandingkan Keduanya Secara Adil
Untuk menemukan pilihan tercepat bagi kebutuhan tertentu, pengujian harus menggunakan konfigurasi yang setara:
- gunakan model dan tokenizer yang sama;
- samakan tingkat presisi atau kuantisasi;
- gunakan perangkat keras yang sama;
- samakan panjang prompt dan target keluaran;
- lakukan pemanasan model sebelum pengujian;
- ukur TTFT, inter-token latency, dan throughput;
- uji beberapa tingkat concurrency, misalnya 1, 4, 16, dan 64 pengguna;
- pantau VRAM, RAM, daya, dan tingkat kegagalan;
- ulangi pengujian beberapa kali;
- catat seluruh versi perangkat lunak dan parameter.
Jika hanya menguji satu pengguna, hasilnya belum cukup untuk menilai kemampuan serving. Sebaliknya, pengujian dengan puluhan pengguna juga tidak menggambarkan kenyamanan pemakaian pada laptop pribadi.
Jadi, Mana Mesin AI Lokal Paling Kencang?
Jawaban ringkasnya: vLLM biasanya menjadi pilihan paling kencang untuk throughput tinggi dan banyak pengguna, sedangkan Ollama menjadi pilihan paling praktis—dan sering kali sudah sangat cepat—untuk penggunaan personal.
| Aspek | Ollama | vLLM |
|---|---|---|
| Fokus utama | Menjalankan dan mengelola AI lokal dengan mudah | Serving dan inferensi berperforma tinggi |
| Target pengguna | Pengguna pribadi, mahasiswa, developer, tim kecil | Tim platform, perusahaan, penyedia API AI |
| Performa satu pengguna | Cepat dan responsif jika model sesuai perangkat | Dapat sangat cepat, tetapi konfigurasi lebih kompleks |
| Performa banyak pengguna | Mendukung paralelisme, tetapi lebih bergantung pada memori dan konfigurasi | Unggul berkat continuous batching dan penjadwalan serving |
| Manajemen KV cache | Mendukung Flash Attention dan kuantisasi KV cache pada konfigurasi tertentu | PagedAttention serta optimasi cache untuk throughput tinggi |
| Format dan kuantisasi | Sangat erat dengan GGUF dan model terkuantisasi | FP8, INT8, INT4, GPTQ, AWQ, GGUF, dan format lainnya |
| Perangkat keras | CPU, Apple Silicon, serta berbagai GPU konsumen dan server | NVIDIA, AMD, Intel, CPU, serta plugin perangkat keras lain |
| Windows | Didukung secara langsung | Tidak didukung secara native; umumnya menggunakan WSL |
| Skalabilitas multi-GPU | Tersedia, dengan fokus pada kemudahan lokal | Lebih lengkap untuk distributed inference |
| Kemudahan instalasi | Sangat mudah | Lebih teknis |
| API | API native dan kompatibilitas OpenAI | Server kompatibel OpenAI dan API serving lainnya |
| Biaya lisensi mesin | Gratis, MIT | Gratis, Apache 2.0 |
| Skenario terbaik | Eksperimen, coding assistant, chatbot lokal, prototipe | API produksi, chatbot perusahaan, layanan dengan trafik tinggi |
| Kelemahan utama | Bukan pilihan utama untuk serving skala besar | Setup dan operasi lebih kompleks |
Pilih Ollama apabila prioritasmu adalah kemudahan, kompatibilitas desktop, privasi lokal, biaya awal rendah, dan proses eksperimen yang cepat.
Pilih vLLM apabila prioritasmu adalah throughput, utilisasi GPU, banyak pengguna serentak, integrasi infrastruktur produksi, dan kemampuan untuk meningkatkan kapasitas layanan.
Dengan demikian, gelar “paling kencang” bergantung pada lintasan perlombaannya. Untuk satu orang yang ingin segera menjalankan AI pada laptop, Ollama sering menjadi pemenang secara praktis. Untuk sebuah server yang harus melayani puluhan atau ratusan permintaan, vLLM merupakan pilihan yang lebih tepat secara arsitektural.
