Anda mungkin sudah biasa dengan alat seperti ChatGPT, Claude atau Gemini. Walaupun ia hebat, terdapat satu kekurangan: ia berjalan di awan. Ini bermakna setiap perkataan yang anda taip akan dihantar ke pelayan syarikat, yang boleh menimbulkan risiko privasi yang serius jika anda mengendalikan data sensitif atau bekerja dalam sektor yang mana undang-undang melarang maklumat daripada meninggalkan pejabat.
Di sinilah Ollama memainkan peranan, sebuah aplikasi yang pada asasnya menjadikan komputer anda sebagai pusat AI . Lupakan langganan bulanan dan bergantung pada sambungan internet yang stabil; dengan alat ini, anda boleh memuat turun model sumber terbuka dan menjalankannya terus pada perkakasan anda sendiri, mengekalkan kawalan penuh ke atas data anda.
Apakah sebenarnya Ollama dan apakah kelebihannya?
Ollama ialah perisian sumber terbuka yang bertindak sebagai klien untuk mengurus model bahasa besar (LLM). Kelebihan utamanya ialah ia memudahkan kerumitan teknikal , pengendalian pengoptimuman GPU dan pengurusan memori supaya anda hanya perlu melaksanakan arahan dan mula bersembang.
Kelebihannya jelas. Pertama, privasi adalah mutlak kerana tiada apa yang keluar dari mesin anda. Kedua, anda menjimatkan kos token API atau yuran bulanan untuk pelan Plus. Dan ketiga, sebaik sahaja templat berada pada cakera keras anda, anda boleh menggunakannya sepenuhnya di luar talian , sesuai untuk ketika anda berada di dalam pesawat atau di tempat yang mempunyai liputan rangkaian yang lemah.
Walau bagaimanapun, ia tidak semuanya mudah. Kelemahan utamanya ialah anda memerlukan perkakasan yang berkuasa . Jika anda cuba menjalankan model yang besar pada PC dengan RAM yang sedikit, tindak balasnya akan menjadi sangat perlahan sehingga anda mempunyai masa untuk membuat kopi sebelum ia menghabiskan ayatnya. Tambahan pula, AI hanya tahu apa yang dipelajari sehingga tarikh latihannya, jadi ia tidak mempunyai akses kepada berita terkini dalam masa nyata.
Keperluan sistem dan perkakasan yang disyorkan
Untuk mengelakkan pengalaman yang mengecewakan, anda harus melihat komponen anda. Sumber yang paling penting ialah RAM dan VRAM kad grafik anda . Sebagai peraturan umum, model 1.5B memerlukan ruang kira-kira 1GB, tetapi ia memerlukan lebih banyak memori untuk beroperasi dengan lancar.
- Model Mini (270M hingga 4B): Sesuai untuk peralatan sederhana atau mudah alih.
- Model Kecil (4B hingga 14B): Pilihan yang seimbang untuk pengguna di rumah.
- Model Sederhana (14B hingga 70B): Di sini anda memerlukan perkakasan yang serius.
- Model Besar (melebihi 70B): Hanya untuk mesin dengan sumber yang sangat besar.
Bagi GPU pula, mempunyai kad NVIDIA dengan CUDA, kad AMD dengan ROCm atau Mac dengan Apple Metal memberi perbezaan yang besar, mempercepatkan penjanaan teks sebanyak 5 hingga 10 kali ganda berbanding hanya menggunakan CPU. Jika anda ingin membeli peralatan, cari kad grafik dengan sekurang-kurangnya 16GB VRAM supaya anda tidak cepat kehabisan.
Panduan pemasangan langkah demi langkah
Memasang Ollama adalah sangat mudah dan boleh dilakukan dalam beberapa minit bergantung pada sistem pengendalian yang anda gunakan:
Pada Windows , hanya muat turun fail .exe dari laman web rasmi. Ia biasanya akan dipasang dalam folder AppData pengguna. Bagi mereka yang lebih suka kontena, ia juga boleh digunakan menggunakan Docker Desktop dengan menjalankan arahan pemasangan rasmi di terminal.
Bagi pengguna LinuxCara terpantas adalah dengan menggunakan terminal dengan arahan curl -fsSL https://ollama.com/install.sh | shSetelah dipasang, perkhidmatan biasanya berjalan di latar belakang. Jika anda perlu menukar tempat model disimpan untuk mengelakkan cakera utama anda daripada penuh, anda boleh mengedit pembolehubah persekitaran. OVEN_MODELS dalam fail konfigurasi perkhidmatan systemd.
En MacOSPemasangan adalah mudah menggunakan pemasang yang dimuat turun atau menggunakan brew install ollamaSistem ini akan secara automatik memanfaatkan Pecutan logam cip Apple Silicon.
Cara mengurus dan menjalankan model AI
Sebaik sahaja pelayan Ollama aktif (anda akan melihatnya dalam ikon bar tugas), anda boleh mula memuat turun model. Arahan asasnya ialah ollama pull [nombre-del-modelo]walaupun jika anda menggunakan ollama run, sistem akan memuat turun model secara automatik jika anda belum memilikinya.
Terdapat pelbagai kategori model bergantung pada keperluan anda:
- Perbualan: Llama 3 atau Mistral adalah raja di sini kerana keseimbangan antara kualiti dan kelajuannya.
- Pengaturcaraan: CodeLlama atau DeepSeek-Coder sesuai untuk penyahpepijatan kod atau fungsi penjanaan.
- Multimodal (Visi): Model seperti LLaVA membolehkan anda memuat naik imej dan meminta AI untuk menerangkannya.
- Penaakulan (Pemikiran): Model yang direka bentuk untuk menerangkan proses langkah demi langkah.
Untuk berinteraksi, hanya gunakan ollama run llama3 dan anda akan memasuki gesaan interaktif. Dalam sesi ini, anda boleh menggunakan arahan seperti /? untuk mendapatkan bantuan atau /bye Untuk keluar. Jika anda ingin melihat apa yang telah anda pasang, ollama list Ia akan memberikan anda senarai lengkap, dan dengan ollama ps Anda boleh menyemak sama ada model itu dimuatkan ke GPU atau CPU.
Tetapan lanjutan dan penyesuaian
Jika anda seorang pembangun, Ollama adalah lombong emas kerana ia mendedahkan API REST pada port 11434. Ini membolehkan anda menyambungkan AI tempatan ke mana-mana aplikasi. Ia serasi dengan format OpenAI, jadi anda boleh mengintegrasikannya ke dalam VS Code melalui GitHub Copilot (menggunakan pilihan BYOK) atau menggunakan ejen seperti OpenCode.
Satu lagi ciri hebat ialah Modelfile . Ia serupa dengan Dockerfile tetapi untuk AI. Ia membolehkan anda mencipta versi model tersuai dengan mentakrifkan System Prompt tertentu (contohnya, menukar Llama menjadi pakar dalam undang-undang Sepanyol), melaraskan suhu untuk menjadikannya lebih kreatif atau lebih tepat dan menyimpan konfigurasi tersebut di bawah nama tersuai.
Bagi mereka yang mencari antara muka visual yang lebih serupa dengan ChatGPT, kami mengesyorkan memasang Open WebUI . Ia bersambung ke Ollama sebagai backend dan menyediakan pengalaman web lengkap dengan sejarah sembang dan pengurusan dokumen, semuanya berjalan pada rangkaian tempatan anda sendiri.
Petua pengoptimuman dan prestasi
Apabila anda perasan bahawa AI berjalan perlahan, langkah pertama adalah untuk memeriksa kuantisasi . Proses ini mengurangkan ketepatan pemberat model (daripada 16 bit kepada 4 atau 8 bit, sebagai contoh), yang secara drastik mengurangkan RAM yang diperlukan tanpa mengorbankan terlalu banyak kualiti. Model Q4_K_M biasanya merupakan titik terbaik antara prestasi dan ketepatan.
Untuk mengelakkan Ollama daripada menggunakan sumber apabila tidak digunakan, anda boleh melumpuhkan permulaan automatik dalam Pengurus Tugas Windows. Ia juga berguna untuk memantau penggunaan VRAM dalam masa nyata bagi menentukan sama ada model tersebut sedang mengeluarkan RAM sistem, yang akan memperlahankan prestasi dengan ketara.
Kawalan infrastruktur tempatan mendemokrasikan penggunaan kecerdasan buatan, menghapuskan halangan ekonomi langganan dan risiko keselamatan awan. Dengan menggabungkan kuasa model seperti Llama 3 atau Mistral dengan kemudahan pengurusan Ollama, mana-mana peminat atau syarikat boleh membina ekosistem AI peribadi mereka sendiri , mengoptimumkan perkakasan yang tersedia dan menyesuaikan tingkah laku model melalui Modelfiles dan API bersepadu.


