ربما تكون على دراية بأدوات مثل ChatGPT وClaude وGemini. ورغم روعتها، إلا أن هناك عيبًا: فهي تعمل عبر الحوسبة السحابية. هذا يعني أن كل كلمة تكتبها تُرسل إلى خوادم الشركة، مما قد يُشكل خطرًا جسيمًا على الخصوصية إذا كنت تتعامل مع بيانات حساسة أو تعمل في قطاعات يحظر القانون فيها نقل المعلومات خارج المكتب.
هنا يأتي دور أولاما، وهو تطبيق يحوّل حاسوبك إلى مركز تحكم الذكاء الاصطناعي . انسَ الاشتراكات الشهرية والاعتماد على اتصال إنترنت مستقر؛ فباستخدام هذه الأداة، يمكنك تنزيل نماذج مفتوحة المصدر وتشغيلها مباشرةً على جهازك، مع الحفاظ على تحكم كامل في بياناتك.
ما هو برنامج أولاما تحديداً وما هي مزاياه؟
أولاما هو برنامج مفتوح المصدر يعمل كعميل لإدارة نماذج اللغة الكبيرة (LLM). ميزته الرئيسية هي تبسيطه للتعقيدات التقنية ، حيث يتولى تحسين وحدة معالجة الرسومات وإدارة الذاكرة، بحيث يكفي تنفيذ أمر واحد لبدء المحادثة.
المزايا واضحة. أولاً، الخصوصية مضمونة تماماً، إذ لا يتم نقل أي بيانات من جهازك. ثانياً، توفر تكاليف رموز واجهة برمجة التطبيقات أو الرسوم الشهرية لخطط Plus. ثالثاً، بمجرد حفظ القالب على القرص الصلب، يمكنك استخدامه دون اتصال بالإنترنت ، وهو مثالي عند السفر جواً أو في الأماكن ذات التغطية الشبكية الضعيفة.
لكن الأمر ليس بهذه البساطة. العيب الرئيسي هو الحاجة إلى جهاز قوي . إذا حاولت تشغيل نموذج ضخم على جهاز كمبيوتر بذاكرة وصول عشوائي (RAM) محدودة، فسيكون الاستجابة بطيئة للغاية لدرجة أنك ستملك الوقت الكافي لتحضير فنجان قهوة قبل أن ينهي جملته. علاوة على ذلك، لا يعرف الذكاء الاصطناعي إلا ما تعلمه حتى تاريخ تدريبه، لذا فهو لا يستطيع الوصول إلى الأخبار العاجلة في الوقت الفعلي.
متطلبات النظام والأجهزة الموصى بها
لتجنب تجربة محبطة، يُنصح بفحص مكونات جهازك. أهم مورد هو ذاكرة الوصول العشوائي (RAM) وذاكرة الفيديو (VRAM) لبطاقة الرسومات . وكقاعدة عامة، يشغل طراز 1.5B مساحة تقارب 1 جيجابايت، ولكنه يحتاج إلى ذاكرة أكبر ليعمل بسلاسة.
- النماذج المصغرة (من 270 متر إلى 4B): مثالي للمعدات المتواضعة أو المتنقلة.
- النماذج الصغيرة (من 4B إلى 14B): الخيار الأمثل للمستخدم المنزلي.
- الموديلات المتوسطة (من 14B إلى 70B): هنا تحتاج إلى أجهزة قوية.
- النماذج الكبيرة (أكثر من 70B): مخصص فقط للأجهزة ذات الموارد الهائلة.
أما بالنسبة لوحدة معالجة الرسومات (GPU)، فإن امتلاك بطاقة NVIDIA مزودة بتقنية CUDA، أو بطاقة AMD مزودة بتقنية ROCm، أو جهاز Mac مزود بتقنية Apple Metal يُحدث فرقًا شاسعًا، حيث يُسرّع عملية إنشاء النصوص من 5 إلى 10 أضعاف مقارنةً باستخدام وحدة المعالجة المركزية (CPU) فقط. إذا كنت تنوي شراء معدات، فابحث عن بطاقات رسومات بذاكرة وصول عشوائي للفيديو (VRAM) لا تقل عن 16 جيجابايت حتى لا تنفد بسرعة.
دليل التثبيت خطوة بخطوة
يُعد تثبيت برنامج Ollama بسيطًا بشكل مدهش، ويمكن القيام بذلك في غضون دقائق حسب نظام التشغيل الذي تستخدمه:
على نظام ويندوز ، ما عليك سوى تنزيل ملف .exe من الموقع الرسمي. سيتم تثبيته عادةً في مجلد AppData الخاص بالمستخدم. أما بالنسبة لمن يفضلون استخدام الحاويات، فيمكنهم أيضًا نشره باستخدام Docker Desktop عن طريق تشغيل أمر التثبيت الرسمي في سطر الأوامر.
لمستخدمي لينكسأسرع طريقة هي استخدام سطر الأوامر مع الأمر curl -fsSL https://ollama.com/install.sh | shبعد التثبيت، تعمل الخدمة عادةً في الخلفية. إذا كنت بحاجة إلى تغيير مكان تخزين النماذج لتجنب امتلاء القرص الرئيسي، يمكنك تعديل متغير البيئة. نماذج الفرن في ملف تكوين خدمة systemd.
En ماكالتثبيت سهل ومباشر باستخدام برنامج التثبيت الذي تم تنزيله أو حتى باستخدام brew install ollamaسيستفيد النظام تلقائيًا من تسارع المعادن من رقائق أبل سيليكون.
كيفية إدارة وتشغيل نماذج الذكاء الاصطناعي
بمجرد تفعيل خادم أولاما (ستراه في أيقونة شريط المهام)، يمكنك البدء بتنزيل النماذج. الأمر الأساسي هو ollama pull [nombre-del-modelo]مع ذلك، إذا كنت تستخدم ollama run، النظام سيتم تنزيل النموذج تلقائيًا إذا لم يكن لديك بعد.
توجد فئات مختلفة من النماذج حسب احتياجاتك:
- بأسلوب حواري: يُعتبر كل من لاما 3 وميسترال الأفضل هنا بفضل توازنهما بين الجودة والسرعة.
- البرمجة: يُعد CodeLlama أو DeepSeek-Coder مثاليين لتصحيح الأخطاء في التعليمات البرمجية أو إنشاء الدوال.
- متعدد الوسائط (الرؤية): تتيح لك نماذج مثل LLaVA تحميل الصور وطلب من الذكاء الاصطناعي وصفها.
- الاستدلال (التفكير): نماذج مصممة لشرح العمليات خطوة بخطوة.
للتفاعل، استخدم ببساطة ollama run llama3 وستدخل إلى نافذة تفاعلية. خلال هذه الجلسة، يمكنك استخدام أوامر مثل /? للحصول على المساعدة أو /bye للخروج. إذا كنت ترغب في رؤية ما قمت بتثبيته، ollama list سيوفر لك القائمة الكاملة، ومع ollama ps يمكنك التحقق مما إذا كان الطراز يتم تحميلها على وحدة معالجة الرسومات أو وحدة المعالجة المركزية.
الإعدادات المتقدمة والتخصيص
إذا كنت مطور برامج، فإن Ollama كنزٌ ثمينٌ لأنه يوفر واجهة برمجة تطبيقات REST على المنفذ 11434. يتيح لك هذا ربط الذكاء الاصطناعي المحلي بأي تطبيق. وهو متوافق مع تنسيق OpenAI، لذا يمكنك دمجه في VS Code عبر GitHub Copilot (باستخدام خيار BYOK) أو استخدام وكلاء مثل OpenCode.
ومن الميزات القوية الأخرى ملف النموذج (Modelfile ). وهو مشابه لملف Dockerfile ولكن للذكاء الاصطناعي. يتيح لك إنشاء نسخة مخصصة من النموذج عن طريق تحديد موجه نظام معين (على سبيل المثال، تحويل اللاما إلى خبير في القانون الإسباني)، وضبط درجة الحرارة لجعله أكثر إبداعًا أو دقة، وحفظ هذا التكوين باسم مخصص.
بالنسبة لمن يبحثون عن واجهة مرئية أقرب إلى ChatGPT، نوصي بتثبيت Open WebUI . فهو يتصل بـ Ollama كخادم خلفي ويوفر تجربة ويب متكاملة مع سجل المحادثات وإدارة المستندات، وكل ذلك يعمل على شبكتك المحلية.
نصائح لتحسين الأداء
عند ملاحظة بطء أداء الذكاء الاصطناعي، تتمثل الخطوة الأولى في التحقق من عملية التكميم . تعمل هذه العملية على تقليل دقة أوزان النموذج (من 16 بت إلى 4 أو 8 بت، على سبيل المثال)، مما يقلل بشكل كبير من ذاكرة الوصول العشوائي المطلوبة دون التأثير بشكل ملحوظ على الجودة. عادةً ما يكون نموذج Q4_K_M هو الخيار الأمثل الذي يوازن بين الأداء والدقة.
لمنع برنامج أولاما من استهلاك موارد النظام عند عدم استخدامه، يمكنك تعطيل التشغيل التلقائي في إدارة مهام ويندوز. كما يُنصح بمراقبة استخدام ذاكرة الفيديو (VRAM) في الوقت الفعلي لتحديد ما إذا كان البرنامج يستهلك جزءًا من ذاكرة النظام، مما قد يُبطئ الأداء بشكل ملحوظ.
يُتيح التحكم في البنية التحتية المحلية استخدام الذكاء الاصطناعي على نطاق واسع، مما يُزيل العوائق الاقتصادية للاشتراكات والمخاطر الأمنية للحوسبة السحابية. ومن خلال الجمع بين قوة نماذج مثل Llama 3 أو Mistral وسهولة إدارة Ollama، يُمكن لأي مُهتم أو شركة بناء نظام ذكاء اصطناعي خاص بها ، وتحسين استخدام الأجهزة المتاحة وتخصيص سلوك النموذج من خلال ملفات النماذج وواجهات برمجة التطبيقات المُدمجة.


