Cara memasang dan mengkonfigurasi Ollama untuk menjalankan model AI pada PC anda

Kemaskini terakhir: 25 Ogos 2026
Pengarang TecnoDigital

Di dalam PC berprestasi tinggi dengan kad grafik NVIDIA GeForce RTX, sesuai untuk menjalankan model AI tempatan.

Anda mungkin sudah biasa dengan alat seperti ChatGPT, Claude atau Gemini. Walaupun ia hebat, terdapat satu kekurangan kecil: ia berjalan di awan. Ini bermakna setiap perkataan yang anda taip akan dihantar ke pelayan syarikat, yang boleh menjadi sedikit menyusahkan. isu privasi yang serius jika anda mengendalikan data sulit atau bekerja dalam sektor yang mana undang-undang melarang maklumat daripada meninggalkan pejabat.

Di sinilah Ollama memainkan peranan, sebuah aplikasi yang pada asasnya menukarkan komputer anda menjadi Pusat saraf AILupakan tentang langganan bulanan dan bergantung pada sambungan internet yang stabil; dengan alat ini, anda boleh memuat turun templat sumber terbuka dan menjalankannya terus pada perkakasan anda sendiri, mengekalkan kawalan mutlak ke atas data anda.

Apakah sebenarnya Ollama dan apakah kelebihannya?

Skrin komputer dengan ikon mangga dan perkataan 'Secured', mewakili privasi data di premis tempatan.

Ollama ialah perisian sumber terbuka yang bertindak sebagai klien untuk mengurus model bahasa yang luas (LLM). Kekuatan utamanya ialah memudahkan kerumitan teknikal, menjaga pengoptimuman GPU dan pengurusan memori supaya anda hanya perlu menjalankan satu arahan dan mula bersembang.

Kelebihannya jelas. Pertama, Privasi adalah menyeluruh Oleh kerana tiada apa yang meninggalkan mesin anda. Kedua, anda menjimatkan kos token API atau yuran pelan Plus bulanan. Dan ketiga, sebaik sahaja model berada pada cakera keras anda, anda boleh menggunakannya. luar talian sepenuhnyaSesuai untuk ketika anda berada di dalam kapal terbang atau di tempat yang mempunyai perlindungan yang teruk.

Walau bagaimanapun, bukan semuanya cerah dan indah. Kelemahan utamanya ialah Anda memerlukan perkakasan yang berkuasaJika anda cuba menjalankan model yang besar pada PC dengan RAM yang sedikit, tindak balasnya akan menjadi sangat perlahan sehingga anda mempunyai masa untuk membuat kopi sebelum ia menghabiskan ayatnya. Tambahan pula, AI hanya tahu apa yang dipelajarinya sehingga tarikh latihannya, jadi ia tidak mempunyai akses kepada berita terkini dalam masa nyata.

  Sumber Web Terbaik untuk Pelayan SQL: Panduan Lengkap

Keperluan sistem dan perkakasan yang disyorkan

Persekitaran pembangunan profesional dengan berbilang monitor yang memaparkan kod dan tetapan API.

Untuk mengelakkan pengalaman yang mengecewakan, anda harus melihat komponen anda. Sumber yang paling penting ialah RAM dan VRAM kad grafik anda. Sebagai peraturan umum, model 1.5B mengambil kira-kira 1GB ruang, tetapi memerlukan lebih banyak memori untuk beroperasi dengan lancar.

  • Model Mini (270M hingga 4B): Sesuai untuk peralatan sederhana atau mudah alih.
  • Model Kecil (4B hingga 14B): Pilihan yang seimbang untuk pengguna di rumah.
  • Model Sederhana (14B hingga 70B): Di sini anda memerlukan perkakasan yang serius.
  • Model Besar (melebihi 70B): Hanya untuk mesin dengan sumber yang sangat besar.

Bagi GPU pula, mempunyai NVIDIA dengan CUDA, AMD dengan ROCm atau Mac dengan Apple Metal memberi perbezaan yang besar, mempercepatkan penjanaan teks. antara 5 dan 10 kali Berkenaan penggunaan CPU sahaja: Jika anda ingin membeli peralatan, cari kad grafik dengan sekurang-kurangnya 16GB VRAM supaya anda tidak cepat kehabisan RAM.

Panduan pemasangan langkah demi langkah

Memasang Ollama adalah sangat mudah dan boleh dilakukan dalam beberapa minit bergantung pada sistem pengendalian yang anda gunakan:

En WindowsMuat turun fail .exe dari laman web rasmi. Ia biasanya akan dipasang dalam folder AppData pengguna. Bagi mereka yang lebih suka kontena, ia juga boleh digunakan menggunakan Desktop Docker, menjalankan arahan pemasangan rasmi di terminal.

Bagi pengguna LinuxCara terpantas adalah dengan menggunakan terminal dengan arahan curl -fsSL https://ollama.com/install.sh | shSetelah dipasang, perkhidmatan biasanya berjalan di latar belakang. Jika anda perlu menukar tempat model disimpan untuk mengelakkan cakera utama anda daripada penuh, anda boleh mengedit pembolehubah persekitaran. OVEN_MODELS dalam fail konfigurasi perkhidmatan systemd.

  Sumber web terbaik untuk .NET

En MacOSPemasangan adalah mudah menggunakan pemasang yang dimuat turun atau menggunakan brew install ollamaSistem ini akan secara automatik memanfaatkan Pecutan logam cip Apple Silicon.

Cara mengurus dan menjalankan model AI

Sebaik sahaja pelayan Ollama aktif (anda akan melihatnya dalam ikon bar tugas), anda boleh mula memuat turun model. Arahan asasnya ialah ollama pull [nombre-del-modelo]walaupun jika anda menggunakan ollama run, sistem akan memuat turun model secara automatik jika anda belum memilikinya.

Terdapat pelbagai kategori model bergantung pada keperluan anda:

  • Perbualan: Llama 3 atau Mistral adalah raja di sini kerana keseimbangan antara kualiti dan kelajuannya.
  • Pengaturcaraan: CodeLlama atau DeepSeek-Coder sesuai untuk penyahpepijatan kod atau fungsi penjanaan.
  • Multimodal (Visi): Model seperti LLaVA membolehkan anda memuat naik imej dan meminta AI untuk menerangkannya.
  • Penaakulan (Pemikiran): Model yang direka bentuk untuk menerangkan proses langkah demi langkah.

Untuk berinteraksi, hanya gunakan ollama run llama3 dan anda akan memasuki gesaan interaktif. Dalam sesi ini, anda boleh menggunakan arahan seperti /? untuk mendapatkan bantuan atau /bye Untuk keluar. Jika anda ingin melihat apa yang telah anda pasang, ollama list Ia akan memberikan anda senarai lengkap, dan dengan ollama ps Anda boleh menyemak sama ada model itu dimuatkan ke GPU atau CPU.

Tetapan lanjutan dan penyesuaian

Jika anda seorang pembangun, Ollama ialah lombong emas kerana ia mendedahkan API REST pada port 11434Ini membolehkan anda menyambungkan AI tempatan ke mana-mana aplikasi. Ia serasi dengan format OpenAI, jadi anda boleh mengintegrasikannya ke dalam VS Code melalui GitHub Copilot (menggunakan pilihan BYOK) atau menggunakan ejen seperti OpenCode.

Satu lagi ciri yang hebat ialah Fail modelIa serupa dengan Dockerfile tetapi untuk AI. Ia membolehkan anda mencipta versi tersuai model dengan mentakrifkan Gesaan Sistem khusus (contohnya, menjadikan Llama sebagai pakar dalam undang-undang Sepanyol), laraskan suhu untuk menjadikannya lebih kreatif atau lebih tepat dan simpan konfigurasi tersebut di bawah nama yang betul.

  Cara menggunakan Kecerdasan Buatan tanpa membuat akaun

Bagi mereka yang mencari antara muka visual yang lebih serupa dengan ChatGPT, cadangannya adalah untuk memasangnya Buka WebUIIa bersambung ke Ollama sebagai backend dan menawarkan anda pengalaman web lengkap dengan sejarah sembang dan pengurusan dokumen, semuanya berjalan pada rangkaian tempatan anda sendiri.

Petua pengoptimuman dan prestasi

Apabila anda perasan bahawa AI perlahan, langkah pertama ialah memeriksa kuantisasiProses ini mengurangkan ketepatan pemberat model (daripada 16 bit kepada 4 atau 8 bit, contohnya), yang secara drastik mengurangkan RAM yang diperlukan tanpa mengorbankan terlalu banyak kualiti. Model S4_K_M Ia biasanya merupakan titik manis antara prestasi dan ketepatan.

Untuk mengelakkan Ollama daripada menggunakan sumber apabila anda tidak menggunakannya, anda boleh melumpuhkan permulaan automatik dalam Pengurus Tugas Windows. Ia juga berguna untuk memantau penggunaan VRAM dalam masa nyata untuk melihat sama ada model tersebut menghasilkan pemunggahan kepada RAM sistem, yang memperlahankan tindak balas dengan ketara.

Kawalan infrastruktur tempatan mendemokrasikan penggunaan kecerdasan buatan, menghapuskan halangan ekonomi langganan dan risiko keselamatan awan. Dengan menggabungkan kuasa model seperti Llama 3 atau Mistral dengan kemudahan pengurusan Ollama, mana-mana peminat atau syarikat boleh menubuhkan syarikat mereka sendiri. ekosistem AI persendirian, mengoptimumkan perkakasan yang tersedia dan menyesuaikan tingkah laku model melalui Modelfiles dan API bersepadu.