Hướng dẫn cài đặt và cấu hình Ollama để chạy các mô hình AI trên máy tính của bạn.

Cập nhật lần cuối: 25 Tháng Tám 2026

Bên trong một máy tính hiệu năng cao với card đồ họa NVIDIA GeForce RTX, lý tưởng để chạy các mô hình AI cục bộ.

Có lẽ bạn đã quen thuộc với các công cụ như ChatGPT, Claude hoặc Gemini. Mặc dù chúng rất tuyệt vời, nhưng có một điều cần lưu ý: chúng hoạt động trên nền tảng đám mây. Điều này có nghĩa là mọi từ bạn gõ đều được truyền đến máy chủ của công ty, điều này có thể gây ra rủi ro nghiêm trọng về quyền riêng tư nếu bạn xử lý dữ liệu nhạy cảm hoặc làm việc trong các lĩnh vực mà luật pháp cấm việc tiết lộ thông tin ra khỏi văn phòng.

Đây là lúc Ollama phát huy tác dụng, một ứng dụng về cơ bản biến máy tính của bạn thành trung tâm điều khiển của trí tuệ nhân tạo . Hãy quên đi các gói đăng ký hàng tháng và việc phụ thuộc vào kết nối internet ổn định; với công cụ này, bạn có thể tải xuống các mô hình mã nguồn mở và chạy chúng trực tiếp trên phần cứng của mình, duy trì quyền kiểm soát hoàn toàn đối với dữ liệu của bạn.

Ollama là gì và nó có những ưu điểm gì?

Màn hình máy tính hiển thị biểu tượng ổ khóa và chữ "Đã bảo mật", thể hiện sự bảo mật dữ liệu trong phạm vi cơ sở mạng cục bộ.

Ollama là một phần mềm mã nguồn mở hoạt động như một máy khách để quản lý các mô hình ngôn ngữ lớn (LLM). Ưu điểm chính của nó là đơn giản hóa sự phức tạp về kỹ thuật , xử lý tối ưu hóa GPU và quản lý bộ nhớ, vì vậy bạn chỉ cần thực hiện một lệnh và bắt đầu trò chuyện.

Ưu điểm rất rõ ràng. Thứ nhất, quyền riêng tư được đảm bảo tuyệt đối vì không có dữ liệu nào rời khỏi máy tính của bạn. Thứ hai, bạn tiết kiệm được chi phí mã thông báo API hoặc phí hàng tháng cho các gói Plus. Và thứ ba, sau khi mẫu được lưu trên ổ cứng, bạn có thể sử dụng nó hoàn toàn ngoại tuyến , rất lý tưởng khi bạn đang trên máy bay hoặc ở những nơi có vùng phủ sóng mạng yếu.

Tuy nhiên, không phải mọi thứ đều hoàn hảo. Nhược điểm chính là bạn cần phần cứng mạnh mẽ . Nếu bạn cố gắng chạy một mô hình lớn trên PC có ít RAM, tốc độ phản hồi sẽ chậm đến mức bạn có đủ thời gian pha một tách cà phê trước khi nó nói xong câu. Hơn nữa, AI chỉ biết những gì nó đã học được cho đến ngày huấn luyện, vì vậy nó không có quyền truy cập vào tin tức nóng hổi trong thời gian thực.

  Tài nguyên web tốt nhất cho SQL Server: Hướng dẫn đầy đủ

Yêu cầu hệ thống và phần cứng đề xuất

Môi trường phát triển chuyên nghiệp với nhiều màn hình hiển thị mã nguồn và cài đặt API.

Để tránh những trải nghiệm khó chịu, bạn nên kiểm tra các thành phần của mình. Tài nguyên quan trọng nhất là RAM và VRAM của card đồ họa . Thông thường, một card đồ họa 1.5B chiếm khoảng 1GB dung lượng, nhưng nó cần nhiều bộ nhớ hơn để hoạt động mượt mà.

  • Mô hình thu nhỏ (270M đến 4B): Thích hợp cho các thiết bị nhỏ gọn hoặc di động.
  • Mô hình nhỏ (4B đến 14B): Lựa chọn cân bằng dành cho người dùng gia đình.
  • Các mẫu cỡ trung bình (14B đến 70B): Ở đây bạn cần phần cứng mạnh mẽ.
  • Mô hình lớn (trên 70B): Chỉ dành cho những cỗ máy có nguồn lực khổng lồ.

Về phần GPU, việc sở hữu card NVIDIA có CUDA, card AMD có ROCm, hoặc máy Mac có Apple Metal sẽ tạo ra sự khác biệt rất lớn, giúp tăng tốc độ tạo văn bản lên 5 đến 10 lần so với chỉ sử dụng CPU. Nếu bạn định mua thiết bị, hãy tìm card đồ họa có ít nhất 16GB VRAM để không bị hết dung lượng quá nhanh.

Hướng dẫn cài đặt từng bước

Việc cài đặt Ollama khá đơn giản và có thể hoàn tất chỉ trong vài phút tùy thuộc vào hệ điều hành bạn đang sử dụng:

Trên Windows , chỉ cần tải xuống tệp .exe từ trang web chính thức. Thông thường, tệp sẽ được cài đặt trong thư mục AppData của người dùng. Đối với những người thích sử dụng container, cũng có thể triển khai bằng Docker Desktop bằng cách chạy lệnh cài đặt chính thức trong terminal.

Dành cho người dùng LinuxCách nhanh nhất là sử dụng cửa sổ dòng lệnh (terminal) với lệnh sau: curl -fsSL https://ollama.com/install.sh | shSau khi cài đặt, dịch vụ thường chạy ngầm. Nếu cần thay đổi vị trí lưu trữ mô hình để tránh làm đầy ổ đĩa chính, bạn có thể chỉnh sửa biến môi trường. MẪU LÒ NƯỚNG trong tệp cấu hình dịch vụ systemd.

  Các nguồn tài nguyên web tốt nhất cho .NET

En macOSViệc cài đặt rất đơn giản bằng cách sử dụng trình cài đặt đã tải xuống hoặc thậm chí bằng cách sử dụng... brew install ollamaHệ thống sẽ tự động tận dụng lợi thế của Gia tốc kim loại của chip Apple Silicon.

Cách quản lý và vận hành các mô hình AI

Sau khi máy chủ Ollama hoạt động (bạn sẽ thấy biểu tượng trên thanh tác vụ), bạn có thể bắt đầu tải xuống các mô hình. Lệnh cơ bản là... ollama pull [nombre-del-modelo]mặc dù nếu bạn sử dụng ollama run, hệ thống sẽ tự động tải xuống mô hình nếu bạn chưa có nó.

Có nhiều loại mô hình khác nhau tùy thuộc vào nhu cầu của bạn:

  • Mang tính hội thoại: Llama 3 hoặc Mistral là những "ông vua" ở đây nhờ sự cân bằng giữa chất lượng và tốc độ.
  • Lập trình: CodeLlama hoặc DeepSeek-Coder là những công cụ lý tưởng để gỡ lỗi mã hoặc tạo hàm.
  • Đa phương thức (Thị giác): Các mô hình như LLaVA cho phép bạn tải lên hình ảnh và yêu cầu trí tuệ nhân tạo mô tả chúng.
  • Lý luận (Suy nghĩ): Các mô hình được thiết kế để giải thích các quy trình từng bước một.

Để tương tác, chỉ cần sử dụng ollama run llama3 và bạn sẽ được nhắc tương tác. Trong phiên này, bạn có thể sử dụng các lệnh như sau: /? để được giúp đỡ hoặc /bye Để thoát. Nếu bạn muốn xem những gì mình đã cài đặt, ollama list Nó sẽ cung cấp cho bạn danh sách đầy đủ, và kèm theo... ollama ps Bạn có thể kiểm tra xem mô hình có phải là được tải lên GPU hoặc CPU.

Cài đặt nâng cao và tùy chỉnh

Nếu bạn là nhà phát triển, Ollama là một kho báu vì nó cung cấp API REST trên cổng 11434. Điều này cho phép bạn kết nối AI cục bộ với bất kỳ ứng dụng nào. Nó tương thích với định dạng OpenAI, vì vậy bạn có thể tích hợp nó vào VS Code thông qua GitHub Copilot (sử dụng tùy chọn BYOK) hoặc sử dụng các agent như OpenCode.

Một tính năng mạnh mẽ khác là Modelfile . Nó tương tự như Dockerfile nhưng dành cho AI. Nó cho phép bạn tạo một phiên bản tùy chỉnh của mô hình bằng cách xác định một Lời nhắc Hệ thống cụ thể (ví dụ: biến Llama thành chuyên gia về luật Tây Ban Nha), điều chỉnh nhiệt độ để làm cho nó sáng tạo hơn hoặc chính xác hơn, và lưu cấu hình đó dưới một tên tùy chỉnh.

  Cách sử dụng Trí tuệ Nhân tạo mà không cần tạo tài khoản

Đối với những ai tìm kiếm giao diện trực quan tương tự như ChatGPT, chúng tôi khuyên bạn nên cài đặt Open WebUI . Nó kết nối với Ollama như một hệ thống phụ trợ và cung cấp trải nghiệm web hoàn chỉnh với lịch sử trò chuyện và quản lý tài liệu, tất cả đều chạy trên mạng cục bộ của bạn.

Mẹo tối ưu hóa và hiệu suất

Khi bạn nhận thấy AI chạy chậm, bước đầu tiên là kiểm tra lượng tử hóa . Quá trình này làm giảm độ chính xác của trọng số mô hình (ví dụ: từ 16 bit xuống 4 hoặc 8 bit), giúp giảm đáng kể lượng RAM cần thiết mà không làm giảm chất lượng quá nhiều. Mô hình Q4_K_M thường là điểm tối ưu giữa hiệu suất và độ chính xác.

Để ngăn Ollama tiêu tốn tài nguyên khi không sử dụng, bạn có thể tắt chế độ khởi động tự động trong Trình quản lý tác vụ Windows. Việc theo dõi mức sử dụng VRAM theo thời gian thực cũng rất hữu ích để xác định xem mô hình có đang chiếm dụng RAM hệ thống hay không, vì điều này làm giảm hiệu năng đáng kể.

Việc kiểm soát cơ sở hạ tầng cục bộ giúp dân chủ hóa việc sử dụng trí tuệ nhân tạo, loại bỏ các rào cản kinh tế của việc đăng ký và rủi ro bảo mật của điện toán đám mây. Bằng cách kết hợp sức mạnh của các mô hình như Llama 3 hoặc Mistral với sự dễ dàng quản lý của Ollama, bất kỳ người đam mê hoặc công ty nào cũng có thể xây dựng hệ sinh thái AI riêng của mình , tối ưu hóa phần cứng hiện có và tùy chỉnh hành vi của mô hình thông qua các Modelfile và API tích hợp.