Hướng dẫn cài đặt và cấu hình Ollama để chạy các mô hình AI trên máy tính của bạn.

Cập nhật lần cuối: 25 Tháng Tám 2026

Bên trong một máy tính hiệu năng cao với card đồ họa NVIDIA GeForce RTX, lý tưởng để chạy các mô hình AI cục bộ.

Có lẽ bạn đã quen thuộc với các công cụ như ChatGPT, Claude hoặc Gemini. Mặc dù chúng rất tuyệt vời, nhưng có một nhược điểm nhỏ: chúng hoạt động trên nền tảng đám mây. Điều này có nghĩa là mọi từ bạn gõ đều được gửi đến máy chủ của công ty, điều này có thể gây ra một chút rắc rối. vấn đề riêng tư nghiêm trọng Nếu bạn xử lý dữ liệu mật hoặc làm việc trong các lĩnh vực mà luật pháp cấm việc tiết lộ thông tin ra khỏi văn phòng.

Đây là lúc Ollama phát huy tác dụng, một ứng dụng về cơ bản biến máy tính của bạn thành... trung tâm điều khiển AIHãy quên đi việc phải trả phí thuê bao hàng tháng và phụ thuộc vào kết nối internet ổn định; với công cụ này, bạn có thể tải xuống các mẫu mã nguồn mở và chạy chúng trực tiếp trên phần cứng của mình, duy trì quyền kiểm soát tuyệt đối đối với dữ liệu của bạn.

Ollama là gì và nó có những ưu điểm gì?

Màn hình máy tính hiển thị biểu tượng ổ khóa và chữ "Đã bảo mật", thể hiện sự bảo mật dữ liệu trong phạm vi cơ sở mạng cục bộ.

Ollama là một phần mềm mã nguồn mở hoạt động như một máy khách để quản lý các mô hình ngôn ngữ mở rộng (LLM). Điểm mạnh chính của nó là... đơn giản hóa sự phức tạp về mặt kỹ thuậtNó đảm nhiệm việc tối ưu hóa GPU và quản lý bộ nhớ, nhờ đó bạn chỉ cần chạy một lệnh duy nhất và bắt đầu trò chuyện.

Ưu điểm rất rõ ràng. Thứ nhất, Quyền riêng tư được đảm bảo tuyệt đối. Vì không có gì rời khỏi máy tính của bạn. Thứ hai, bạn tiết kiệm được chi phí mã thông báo API hoặc phí gói Plus hàng tháng. Và thứ ba, một khi mô hình đã được lưu trên ổ cứng, bạn có thể sử dụng nó ngay lập tức. hoàn toàn ngoại tuyếnRất lý tưởng khi bạn đang trên máy bay hoặc ở những nơi có sóng yếu.

Tuy nhiên, không phải mọi thứ đều suôn sẻ. Nhược điểm chính là... Bạn cần phần cứng mạnh mẽNếu bạn cố gắng chạy một mô hình khổng lồ trên máy tính có RAM ít, tốc độ phản hồi sẽ chậm đến mức bạn có đủ thời gian pha một tách cà phê trước khi nó hoàn thành câu nói. Hơn nữa, AI chỉ biết những gì nó đã học được cho đến ngày huấn luyện, vì vậy nó không có quyền truy cập vào tin tức nóng hổi trong thời gian thực.

  Tài nguyên web tốt nhất cho SQL Server: Hướng dẫn đầy đủ

Yêu cầu hệ thống và phần cứng đề xuất

Môi trường phát triển chuyên nghiệp với nhiều màn hình hiển thị mã nguồn và cài đặt API.

Để tránh những trải nghiệm khó chịu, bạn nên xem xét các thành phần của mình. Tài nguyên quan trọng nhất là... RAM và VRAM của card đồ họa của bạn. Theo nguyên tắc chung, một bộ xử lý 1.5B chiếm khoảng 1GB dung lượng, nhưng cần nhiều bộ nhớ hơn để hoạt động mượt mà.

  • Mô hình thu nhỏ (270M đến 4B): Thích hợp cho các thiết bị nhỏ gọn hoặc di động.
  • Mô hình nhỏ (4B đến 14B): Lựa chọn cân bằng dành cho người dùng gia đình.
  • Các mẫu cỡ trung bình (14B đến 70B): Ở đây bạn cần phần cứng mạnh mẽ.
  • Mô hình lớn (trên 70B): Chỉ dành cho những cỗ máy có nguồn lực khổng lồ.

Về phần GPU, việc sở hữu card NVIDIA có CUDA, AMD có ROCm, hoặc máy Mac có Apple Metal sẽ tạo ra sự khác biệt rất lớn, giúp tăng tốc độ tạo văn bản. từ 5 đến 10 lần Về việc chỉ sử dụng CPU: Nếu bạn định mua thiết bị, hãy tìm card đồ họa có ít nhất 16GB VRAM để không bị thiếu hụt nhanh chóng.

Hướng dẫn cài đặt từng bước

Việc cài đặt Ollama khá đơn giản và có thể hoàn tất chỉ trong vài phút tùy thuộc vào hệ điều hành bạn đang sử dụng:

En Cửa sổChỉ cần tải xuống tệp .exe từ trang web chính thức. Thông thường, nó sẽ được cài đặt trong thư mục AppData của người dùng. Đối với những người thích sử dụng container, nó cũng có thể được triển khai bằng cách sử dụng Máy tính để bàn Docker, bằng cách chạy lệnh cài đặt chính thức trong cửa sổ dòng lệnh.

Dành cho người dùng LinuxCách nhanh nhất là sử dụng cửa sổ dòng lệnh (terminal) với lệnh sau: curl -fsSL https://ollama.com/install.sh | shSau khi cài đặt, dịch vụ thường chạy ngầm. Nếu cần thay đổi vị trí lưu trữ mô hình để tránh làm đầy ổ đĩa chính, bạn có thể chỉnh sửa biến môi trường. MẪU LÒ NƯỚNG trong tệp cấu hình dịch vụ systemd.

  Các nguồn tài nguyên web tốt nhất cho .NET

En macOSViệc cài đặt rất đơn giản bằng cách sử dụng trình cài đặt đã tải xuống hoặc thậm chí bằng cách sử dụng... brew install ollamaHệ thống sẽ tự động tận dụng lợi thế của Gia tốc kim loại của chip Apple Silicon.

Cách quản lý và vận hành các mô hình AI

Sau khi máy chủ Ollama hoạt động (bạn sẽ thấy biểu tượng trên thanh tác vụ), bạn có thể bắt đầu tải xuống các mô hình. Lệnh cơ bản là... ollama pull [nombre-del-modelo]mặc dù nếu bạn sử dụng ollama run, hệ thống sẽ tự động tải xuống mô hình nếu bạn chưa có nó.

Có nhiều loại mô hình khác nhau tùy thuộc vào nhu cầu của bạn:

  • Mang tính hội thoại: Llama 3 hoặc Mistral là những "ông vua" ở đây nhờ sự cân bằng giữa chất lượng và tốc độ.
  • Lập trình: CodeLlama hoặc DeepSeek-Coder là những công cụ lý tưởng để gỡ lỗi mã hoặc tạo hàm.
  • Đa phương thức (Thị giác): Các mô hình như LLaVA cho phép bạn tải lên hình ảnh và yêu cầu trí tuệ nhân tạo mô tả chúng.
  • Lý luận (Suy nghĩ): Các mô hình được thiết kế để giải thích các quy trình từng bước một.

Để tương tác, chỉ cần sử dụng ollama run llama3 và bạn sẽ được nhắc tương tác. Trong phiên này, bạn có thể sử dụng các lệnh như sau: /? để được giúp đỡ hoặc /bye Để thoát. Nếu bạn muốn xem những gì mình đã cài đặt, ollama list Nó sẽ cung cấp cho bạn danh sách đầy đủ, và kèm theo... ollama ps Bạn có thể kiểm tra xem mô hình có phải là được tải lên GPU hoặc CPU.

Cài đặt nâng cao và tùy chỉnh

Nếu bạn là nhà phát triển, Ollama là một kho báu vì nó hé lộ nhiều điều thú vị. API REST trên cổng 11434Điều này cho phép bạn kết nối AI cục bộ với bất kỳ ứng dụng nào. Nó tương thích với định dạng OpenAI, vì vậy bạn có thể tích hợp nó vào VS Code thông qua GitHub Copilot (sử dụng tùy chọn BYOK) hoặc sử dụng các tác nhân như OpenCode.

Một tính năng mạnh mẽ khác là Tệp mô hìnhNó tương tự như Dockerfile nhưng dành cho AI. Nó cho phép bạn tạo một phiên bản tùy chỉnh của mô hình bằng cách định nghĩa một... Lời nhắc hệ thống Cụ thể (ví dụ: biến Llama thành chuyên gia luật Tây Ban Nha), điều chỉnh nhiệt độ để làm cho nó sáng tạo hơn hoặc chính xác hơn, và lưu cấu hình đó với một tên thích hợp.

  Cách sử dụng Trí tuệ Nhân tạo mà không cần tạo tài khoản

Đối với những ai đang tìm kiếm giao diện trực quan tương tự như ChatGPT, chúng tôi khuyên bạn nên cài đặt... Mở WebUINó kết nối với Ollama như một hệ thống phụ trợ và cung cấp cho bạn trải nghiệm web hoàn chỉnh với lịch sử trò chuyện và quản lý tài liệu, tất cả đều hoạt động trên mạng cục bộ của riêng bạn.

Mẹo tối ưu hóa và hiệu suất

Khi bạn nhận thấy AI hoạt động chậm, bước đầu tiên là kiểm tra... lượng tử hóaQuá trình này làm giảm độ chính xác của trọng số mô hình (ví dụ: từ 16 bit xuống 4 hoặc 8 bit), giúp giảm đáng kể lượng RAM cần thiết mà không làm giảm chất lượng quá nhiều. Một mô hình Q4_K_M Đây thường là điểm tối ưu giữa hiệu năng và độ chính xác.

Để ngăn Ollama tiêu tốn tài nguyên khi bạn không sử dụng nó, bạn có thể tắt chức năng này. tự động khởi động trong Trình quản lý tác vụ Windows. Việc theo dõi mức sử dụng VRAM trong thời gian thực cũng rất hữu ích để xem mô hình có đang tạo ra hiệu năng hay không. Dỡ hàng vào bộ nhớ RAM của hệ thống, điều này làm chậm phản hồi đáng kể.

Việc kiểm soát cơ sở hạ tầng cục bộ giúp dân chủ hóa việc sử dụng trí tuệ nhân tạo, loại bỏ các rào cản kinh tế của việc đăng ký thuê bao và các rủi ro bảo mật của điện toán đám mây. Bằng cách kết hợp sức mạnh của các mô hình như Llama 3 hoặc Mistral với sự dễ dàng quản lý của Ollama, bất kỳ người đam mê hoặc công ty nào cũng có thể tự thiết lập hệ thống của riêng mình. hệ sinh thái AI tư nhânTối ưu hóa phần cứng hiện có và tùy chỉnh hành vi của các mô hình thông qua Modelfiles và API tích hợp.