আপনি সম্ভবত ChatGPT, Claude, বা Gemini-এর মতো টুলগুলোর সাথে আগে থেকেই পরিচিত। যদিও এগুলো চমৎকার, তবে একটি সমস্যা আছে: এগুলো ক্লাউডে চলে। এর মানে হলো, আপনার টাইপ করা প্রতিটি শব্দ কোনো একটি কোম্পানির সার্ভারে চলে যায়, যা আপনার গোপনীয়তার জন্য একটি গুরুতর ঝুঁকি তৈরি করতে পারে, বিশেষ করে যদি আপনি সংবেদনশীল তথ্য নিয়ে কাজ করেন বা এমন কোনো ক্ষেত্রে কর্মরত থাকেন যেখানে আইন অনুযায়ী অফিসের বাইরে তথ্য পাঠানো নিষিদ্ধ।
এইখানেই ওলামা কাজে আসে, এমন একটি অ্যাপ্লিকেশন যা আপনার কম্পিউটারকে কার্যত এআই-এর স্নায়ুকেন্দ্রে পরিণত করে । মাসিক সাবস্ক্রিপশন এবং স্থিতিশীল ইন্টারনেট সংযোগের উপর নির্ভর করার কথা ভুলে যান; এই টুলটির সাহায্যে আপনি ওপেন-সোর্স মডেল ডাউনলোড করে সরাসরি আপনার নিজের হার্ডওয়্যারে চালাতে পারবেন এবং আপনার ডেটার উপর সম্পূর্ণ নিয়ন্ত্রণ বজায় রাখতে পারবেন।
ওল্লামা আসলে কী এবং এর সুবিধাগুলো কী কী?
ওলামা একটি ওপেন-সোর্স সফটওয়্যার যা বৃহৎ ভাষা মডেল (LLM) পরিচালনার জন্য ক্লায়েন্ট হিসেবে কাজ করে। এর প্রধান সুবিধা হলো এটি প্রযুক্তিগত জটিলতাকে সহজ করে দেয় , জিপিইউ অপটিমাইজেশন এবং মেমরি ব্যবস্থাপনার দায়িত্ব নিজেই নেয়, ফলে আপনাকে শুধু একটি কমান্ড চালাতে হয় এবং চ্যাটিং শুরু করতে পারেন।
এর সুবিধাগুলো সুস্পষ্ট। প্রথমত, গোপনীয়তা সম্পূর্ণ থাকে, কারণ আপনার মেশিন থেকে কিছুই বাইরে যায় না। দ্বিতীয়ত, আপনার এপিআই টোকেনের খরচ বা প্লাস প্ল্যানের মাসিক ফি বেঁচে যায়। এবং তৃতীয়ত, টেমপ্লেটটি একবার আপনার হার্ড ড্রাইভে চলে এলে, আপনি এটি সম্পূর্ণ অফলাইনে ব্যবহার করতে পারবেন , যা প্লেনে বা দুর্বল নেটওয়ার্ক কভারেজের জায়গায় থাকার জন্য আদর্শ।
তবে, সবকিছুই যে খুব ভালো তা নয়। এর প্রধান অসুবিধা হলো, এর জন্য শক্তিশালী হার্ডওয়্যার প্রয়োজন । যদি আপনি কম র্যামের কোনো পিসিতে একটি বিশাল মডেল চালানোর চেষ্টা করেন, তবে এর প্রতিক্রিয়া এতটাই ধীর হবে যে, এর বাক্য শেষ হতে হতেই আপনি কফি বানিয়ে ফেলার সময় পেয়ে যাবেন। তাছাড়া, এআই কেবল তার প্রশিক্ষণের তারিখ পর্যন্ত যা শিখেছে, তা-ই জানে, তাই রিয়েল-টাইমে সর্বশেষ খবর পাওয়ার সুযোগ তার থাকে না।
সিস্টেমের প্রয়োজনীয়তা এবং প্রস্তাবিত হার্ডওয়্যার
হতাশাজনক অভিজ্ঞতা এড়াতে, আপনার কম্পোনেন্টগুলো একবার দেখে নেওয়া উচিত। সবচেয়ে গুরুত্বপূর্ণ রিসোর্স হলো আপনার গ্রাফিক্স কার্ডের র্যাম (RAM) এবং ভি-র্যাম (VRAM) । সাধারণত, একটি ১.৫বি মডেল প্রায় ১জিবি জায়গা নেয়, কিন্তু এটি মসৃণভাবে কাজ করার জন্য আরও বেশি মেমোরির প্রয়োজন হয়।
- মিনি মডেল (২৭০এম থেকে ৪বি): ছোট বা বহনযোগ্য সরঞ্জামের জন্য আদর্শ।
- ছোট মডেল (4B থেকে 14B): গৃহ ব্যবহারকারীদের জন্য একটি ভারসাম্যপূর্ণ বিকল্প।
- মাঝারি মডেল (14B থেকে 70B): এখানে আপনার শক্তিশালী হার্ডওয়্যার প্রয়োজন।
- বড় মডেল (৭০বি-এর বেশি): শুধুমাত্র বিপুল সম্পদসম্পন্ন মেশিনগুলোর জন্য।
জিপিইউ-এর ক্ষেত্রে, CUDA সহ একটি NVIDIA কার্ড, ROCm সহ একটি AMD কার্ড, অথবা Apple Metal সহ একটি ম্যাক ব্যবহার করলে অনেক বড় পার্থক্য তৈরি হয়, যা শুধুমাত্র সিপিইউ ব্যবহারের তুলনায় টেক্সট জেনারেশনের গতি ৫ থেকে ১০ গুণ বাড়িয়ে দেয়। আপনি যদি সরঞ্জাম কিনতে যান, তবে অন্তত ১৬ জিবি ভিআরএএম সহ গ্রাফিক্স কার্ড খুঁজুন, যাতে এটি দ্রুত শেষ না হয়ে যায়।
ধাপে ধাপে ইনস্টলেশন নির্দেশিকা
ওলামা ইনস্টল করা আশ্চর্যজনকভাবে সহজ এবং আপনার ব্যবহৃত অপারেটিং সিস্টেমের উপর নির্ভর করে এটি কয়েক মিনিটের মধ্যেই করা যেতে পারে:
উইন্ডোজে , অফিসিয়াল ওয়েবসাইট থেকে সরাসরি .exe ফাইলটি ডাউনলোড করুন। এটি সাধারণত ব্যবহারকারীর AppData ফোল্ডারে ইনস্টল হবে। যারা কন্টেইনার পছন্দ করেন, তারা টার্মিনালে অফিসিয়াল ইনস্টলেশন কমান্ডটি চালিয়ে ডকার ডেস্কটপ ব্যবহার করেও এটি স্থাপন করতে পারেন ।
ব্যবহারকারীদের জন্য লিনাক্সসবচেয়ে দ্রুত উপায় হলো টার্মিনালে এই কমান্ডটি ব্যবহার করা। curl -fsSL https://ollama.com/install.sh | shএকবার ইনস্টল হয়ে গেলে, সার্ভিসটি সাধারণত ব্যাকগ্রাউন্ডে চলতে থাকে। আপনার প্রধান ডিস্ক ভরে যাওয়া এড়াতে মডেলগুলো কোথায় সংরক্ষিত হবে তা যদি পরিবর্তন করার প্রয়োজন হয়, তবে আপনি এনভায়রনমেন্ট ভেরিয়েবলটি এডিট করতে পারেন। ওভেন_মডেল systemd সার্ভিস কনফিগারেশন ফাইলে।
En MacOSডাউনলোড করা ইনস্টলার ব্যবহার করে অথবা এমনকি ব্যবহার করেও ইনস্টলেশনটি সহজ। brew install ollamaসিস্টেমটি স্বয়ংক্রিয়ভাবে এর সুবিধা নেবে ধাতব ত্বরণ অ্যাপল সিলিকন চিপস।
এআই মডেলগুলি কীভাবে পরিচালনা ও চালানো যায়
ওলামা সার্ভারটি সক্রিয় হয়ে গেলে (আপনি এটি টাস্কবার আইকনে দেখতে পাবেন), আপনি মডেল ডাউনলোড করা শুরু করতে পারেন। এর মূল কমান্ডটি হলো... ollama pull [nombre-del-modelo]যদিও যদি আপনি ব্যবহার করেন ollama run, পদ্ধতি মডেলটি স্বয়ংক্রিয়ভাবে ডাউনলোড হবে যদি আপনার কাছে এখনও না থাকে
আপনার প্রয়োজন অনুসারে বিভিন্ন শ্রেণীর মডেল রয়েছে:
- কথোপকথনমূলক: গুণমান ও গতির মধ্যে ভারসাম্যের কারণে লামা ৩ বা মিস্ট্রাল এখানে সেরা।
- প্রোগ্রামিং: কোড ডিবাগ করতে বা ফাংশন তৈরি করতে CodeLlama বা DeepSeek-Coder আদর্শ।
- মাল্টিমোডাল (দৃষ্টি): LLaVA-এর মতো মডেলগুলো আপনাকে ছবি আপলোড করার এবং সেগুলোর বর্ণনা দিতে AI-কে অনুরোধ করার সুযোগ দেয়।
- যুক্তি (চিন্তা): প্রক্রিয়াগুলো ধাপে ধাপে ব্যাখ্যা করার জন্য তৈরি মডেল।
যোগাযোগ করতে, শুধু ব্যবহার করুন ollama run llama3 এবং আপনি একটি ইন্টারেক্টিভ প্রম্পটে প্রবেশ করবেন। এই সেশনের মধ্যে, আপনি নিম্নলিখিত কমান্ডগুলি ব্যবহার করতে পারবেন, যেমন /? সাহায্যের জন্য অথবা /bye প্রস্থান করতে। আপনি কী ইনস্টল করেছেন তা দেখতে চাইলে, ollama list এটি আপনাকে সম্পূর্ণ তালিকাটি দেবে, এবং সাথে ollama ps আপনি মডেলটি কিনা তা পরীক্ষা করতে পারেন GPU বা CPU-তে লোড করা হয়.
উন্নত সেটিংস এবং কাস্টমাইজেশন
আপনি যদি একজন ডেভেলপার হন, তাহলে Ollama আপনার জন্য একটি সোনার খনি, কারণ এটি ১১৪৩৪ পোর্টে একটি REST API প্রদান করে । এর মাধ্যমে আপনি আপনার লোকাল AI-কে যেকোনো অ্যাপ্লিকেশনের সাথে সংযুক্ত করতে পারবেন। এটি OpenAI ফরম্যাটের সাথে সামঞ্জস্যপূর্ণ, তাই আপনি GitHub Copilot-এর মাধ্যমে (BYOK অপশনটি ব্যবহার করে) এটিকে VS Code-এ ইন্টিগ্রেট করতে পারেন অথবা OpenCode-এর মতো এজেন্ট ব্যবহার করতে পারেন।
এর আরেকটি শক্তিশালী বৈশিষ্ট্য হলো মডেলফাইল (Modelfile )। এটি ডকারফাইলের (Dockerfile) মতোই, তবে এআই (AI)-এর জন্য। এর মাধ্যমে আপনি একটি নির্দিষ্ট সিস্টেম প্রম্পট (System Prompt) নির্ধারণ করে (যেমন, লামাকে স্প্যানিশ আইনের বিশেষজ্ঞে পরিণত করা), এটিকে আরও সৃজনশীল বা আরও সুনির্দিষ্ট করার জন্য তাপমাত্রা সামঞ্জস্য করে এবং সেই কনফিগারেশনটি একটি কাস্টম নামে সংরক্ষণ করে একটি মডেলের নিজস্ব সংস্করণ তৈরি করতে পারেন।
যারা ChatGPT-এর মতো ভিজ্যুয়াল ইন্টারফেস খুঁজছেন, তাদের জন্য আমরা Open WebUI ইনস্টল করার পরামর্শ দিই । এটি ব্যাকএন্ড হিসেবে Ollama-এর সাথে সংযুক্ত হয় এবং চ্যাট হিস্ট্রি ও ডকুমেন্ট ম্যানেজমেন্ট সহ একটি সম্পূর্ণ ওয়েব অভিজ্ঞতা প্রদান করে, যা আপনার নিজের লোকাল নেটওয়ার্কেই চলে।
অপ্টিমাইজেশন এবং পারফরম্যান্স টিপস
যখন আপনি লক্ষ্য করেন যে এআই (AI) ধীরগতিতে চলছে, তখন প্রথম পদক্ষেপ হলো কোয়ান্টাইজেশন (quantization ) পরীক্ষা করা । এই প্রক্রিয়াটি মডেলের ওয়েটগুলোর প্রিসিশন (precision) কমিয়ে দেয় (উদাহরণস্বরূপ, ১৬ বিট থেকে ৪ বা ৮ বিটে), যা গুণমানের খুব বেশি ক্ষতি না করেই প্রয়োজনীয় র্যামের (RAM) পরিমাণ ব্যাপকভাবে হ্রাস করে। একটি Q4_K_M মডেল সাধারণত পারফরম্যান্স এবং প্রিসিশনের মধ্যে একটি আদর্শ ভারসাম্য রক্ষা করে।
ব্যবহার না করার সময় ওলামা যাতে রিসোর্স ব্যবহার না করে, সেজন্য আপনি উইন্ডোজ টাস্ক ম্যানেজারে অটোমেটিক স্টার্টআপ নিষ্ক্রিয় করতে পারেন। মডেলটি সিস্টেম র্যামের ওপর চাপ সৃষ্টি করছে কিনা তা নির্ধারণ করতে রিয়েল টাইমে ভিআরএএম (VRAM) ব্যবহার পর্যবেক্ষণ করাও সহায়ক , যা পারফরম্যান্সকে উল্লেখযোগ্যভাবে ধীর করে দেয়।
স্থানীয় পরিকাঠামোর উপর নিয়ন্ত্রণ কৃত্রিম বুদ্ধিমত্তার ব্যবহারকে গণতান্ত্রিক করে তোলে, যা সাবস্ক্রিপশনের অর্থনৈতিক বাধা এবং ক্লাউডের নিরাপত্তা ঝুঁকি দূর করে। Llama 3 বা Mistral-এর মতো মডেলের শক্তির সাথে Ollama-র সহজ ব্যবস্থাপনাকে একত্রিত করে, যেকোনো উৎসাহী ব্যক্তি বা কোম্পানি তাদের নিজস্ব ব্যক্তিগত এআই ইকোসিস্টেম তৈরি করতে পারে , এবং সমন্বিত মডেলফাইল ও এপিআই-এর মাধ্যমে উপলব্ধ হার্ডওয়্যারকে সর্বোত্তমভাবে ব্যবহার করে ও মডেলের আচরণকে নিজেদের মতো করে সাজিয়ে নিতে পারে।


