- تعتمد جدوى Ollama بشكل أساسي على ذاكرة الوصول العشوائي (RAM) ووحدة معالجة الرسومات (GPU) وتكميم النموذج، وليس على التطبيق نفسه.
- بفضل ذاكرة الوصول العشوائي بسعة 16 جيجابايت ووحدة معالجة الرسومات بسعة 8-12 جيجابايت، يمكن التعامل مع النماذج الكمية 7B-13B بشكل جيد للاستخدام اليومي.
- تتطلب طرازات 30B–70B وحدات معالجة رسومات (GPUs) بسعة 16–32 جيجابايت من ذاكرة الوصول العشوائي للفيديو (VRAM) وذاكرة وصول عشوائي (RAM) بسعة 32 جيجابايت على الأقل لتكون قابلة للاستخدام حقًا.
- يؤدي اختيار الحجم والتنسيق المناسبين للنموذج الخاص بجهازك إلى منع الأعطال ويتيح استخدام الذكاء الاصطناعي المحلي السلس والخاص.
إذا كنت تفكر في تشغيل نماذج الذكاء الاصطناعي على جهاز الكمبيوتر الخاص بك، فستصادف حتماً برنامج أولاما عاجلاً أم آجلاً. وهنا يبرز السؤال الأهم: ما هي متطلبات الأجهزة اللازمة لتشغيل هذه النماذج بسلاسة ودون أي تقطعات؟ لا يكفي أن تبدأ النماذج بالعمل فحسب، بل الأهم هو أن تكون قابلة للاستخدام بسهولة في المهام اليومية، وفهم أنواع أجهزة الكمبيوتر المختلفة أمر ضروري.
سنستعرض بالتفصيل في هذه المقالة ما يفعله برنامج Llama، وما تتطلبه الأنواع المختلفة من النماذج (7B، 13B، 70B، إلخ)، وكيف يؤثر كل من وحدة المعالجة المركزية ووحدة معالجة الرسومات وذاكرة الوصول العشوائي والقرص على الأداء، وما هي التكوينات المعقولة حسب حالتك ، سواء كنت تريد مساعدًا نصيًا بسيطًا أو تنوي تشغيل برامج ضخمة مثل Llama 3 مع عشرات المليارات من المعلمات أو نماذج الرؤية والتعرف الضوئي على الأحرف.
ما هو أولاما ولماذا تُحدث الأجهزة فرقاً كبيراً؟
أولاما هي في الأساس عميل لنموذج اللغة يسمح لك بتشغيل نماذج اللغة محليًا على جهازك، دون الحاجة إلى الحوسبة السحابية. تستخدم محركات مثل llama.cpp للاستدلال، وتُغلف كل التعقيدات في أداة بسيطة، مع واجهة سطر أوامر وواجهة برمجة تطبيقات REST، كما تساعدك على فهم مفاهيم الشبكات العصبية الاصطناعية التي تقوم عليها النماذج.
يتمثل دورها في أن تكون "مركز التحكم" الذي يمكنك من خلاله تنزيل نماذج مثل Llama 3 وMistral وGemma وPhi وQwen وDeepSeek، أو النماذج متعددة الوسائط مثل Llava، وإدارتها وتشغيلها . وتكمن روعتها في إمكانية استخدامها دون اتصال بالإنترنت، مما يحافظ على بياناتك في مقر عملك، ودون الحاجة إلى دفع رسوم لكل رمز مميز كما هو الحال مع واجهات برمجة التطبيقات السحابية.
على الرغم من أن برنامج أولاما نفسه خفيف الوزن ولا يتطلب موارد كثيرة، إلا أن النماذج التي يشغلها تستهلك موارد ضخمة . يتكون كل نموذج من نماذج التعلم العميق من ملايين أو مليارات المعاملات، مما يعني استهلاك غيغابايتات من الذاكرة والتخزين، بالإضافة إلى تحميل ثقيل على وحدة المعالجة المركزية، ووحدة معالجة الرسومات إن وجدت.
لهذا السبب، عندما يحاول شخص ما تشغيل نموذج كبير (مثل لاما بحجم 70 بايت) على نظام بمعالج مركزي قوي ووحدة معالجة رسومية منفصلة وذاكرة وصول عشوائي كافية، تكون النتيجة عادةً أنه "يعمل"، ولكنه بطيء للغاية لدرجة أنه عديم الفائدة عمليًا . يكمن الحل في تحقيق توازن مناسب بين المعالج المركزي ووحدة معالجة الرسوميات وذاكرة الوصول العشوائي والقرص الصلب ونوع النموذج.
أنواع النماذج في أولاما وكيف تؤثر على المتطلبات
ستجد في مكتبة أولاما نماذج مصنفة حسب العائلات والأحجام: 1B، 2B، 4B، 7B، 13B، 30B، 65B، 70B، 405B... يشير هذا الرقم (B اختصارًا للمليارات) إلى العدد التقريبي للمعلمات، وهو أحد العوامل التي تحدد بشكل كبير الأجهزة اللازمة.
يمكننا تصنيفها بشكل عام إلى أربع فئات ، مما يساعد بشكل كبير في تقدير الآلة التي تحتاجها لتكون مرتاحًا مع كل مجموعة من النماذج والقياسات الكمية:
- نماذج مصغرة (270M – 4B):مصممة ل أجهزة متواضعة (أجهزة الكمبيوتر المحمولة البسيطة، وحتى بعض الهواتف المحمولة أو أجهزة الكمبيوتر الصغيرة). سريعة، ولكن بقدرة أقل على التفكير المنطقي.
- النماذج الصغيرة (4B – 14B)مثالي كـ نموذج "منزلي" متوازنمناسب للمحادثات العامة، ومهام المكتب، والمساعدة البسيطة في البرمجة، وما إلى ذلك.
- الموديلات المتوسطة (14B – 70B)إنهم يلعبون بالفعل في دوري مختلف؛ إنهم بحاجة إلى أجهزة قوية.، الكثير من ذاكرة الوصول العشوائي (RAM)، وإذا أمكن، وحدة معالجة رسومات (GPU) مزودة بالكثير من ذاكرة الوصول العشوائي للفيديو (VRAM).
- الموديلات الكبيرة (> 70B)إنها وحوش مصممة لـ بنى تحتية بالغة الأهمية (وحدات معالجة الرسومات المتطورة، وبطاقات الرسومات المتعددة، والخوادم المخصصة، وأجهزة ماك المتطورة ذات الاستخدام الجيد، وما إلى ذلك).
بالإضافة إلى الحجم، يلعب التكميم دورًا أيضًا : في Ollama سترى لواحق مثل q4_K_M و q5_1 و q3_K_S و q8_0 و f16 وما إلى ذلك. تشير هذه التنسيقات إلى مدى ضغط أوزان النموذج.
- FP16 / FP32 (f16، f32)مضغوطة بالكاد، جودة عالية لكنها تستهلك الذاكرة بشكل كبيريمكن أن تصل قيمة 7B في FP16 إلى أكثر من 20 جيجابايت من ذاكرة الوصول العشوائي للفيديو (VRAM).
- Q4 (q4_0, q4_K_M…): تكميم 4 بت، تقليص كبير في الحجم مع تأثير معتدل على الجودةإنها عادة ما تكون "النقطة المثالية".
- Q3، Q2 (q3_K_S، q2_K…): عمليات تكميم أكثر جرأة، حجم صغير جدًا مقابل فقدان طفيف في الدقةمفيد على الأجهزة ذات الإمكانيات المحدودة للغاية.
- Q5 ، Q6 ، Q8: خطوات وسيطة بين الضغط القوي و FP16؛ جودة أعلى، استهلاك أعلى.
النتيجة العملية واضحة: يمكن أن يشغل نفس طراز 7B حوالي 26 جيجابايت في FP16 أو حوالي 4 جيجابايت في Q4 . وهذا يترجم مباشرة إلى ذاكرة الوصول العشوائي للفيديو (VRAM) الخاصة بوحدة معالجة الرسومات (GPU) التي تحتاجها، وكمية ذاكرة الوصول العشوائي (RAM) التي يجب أن تدعم عبء العمل.
الحد الأدنى من متطلبات الأجهزة الموصى بها لتشغيل Ollama على الشبكة المحلية
إذا كنت قلقًا بشأن قدرة جهاز الكمبيوتر الخاص بك على تشغيل برنامج Ollama، فالإجابة غالبًا هي نعم؛ السؤال هو أي طراز يمكنك تشغيله بسلاسة . دعونا نحلل الأمر حسب المكونات: ذاكرة الوصول العشوائي (RAM)، ووحدة المعالجة المركزية (CPU)، ووحدة معالجة الرسومات (GPU)، والقرص الصلب، مع توصيات واقعية مبنية على الخبرة العملية والوثائق من العديد من الأدلة المتخصصة.
ذاكرة الوصول العشوائي: المورد الحاسم النهائي
تُعدّ ذاكرة الوصول العشوائي (RAM) العائق الرئيسي عند مناقشة برامج الماجستير المحلية في القانون. وبشكل عام، يمكننا النظر في هذه النطاقات:
- غيغابايت من ذاكرة الوصول العشوائي 8: الأرضية العملية. يسمح ذلك بنماذج صغيرة (1B، 3B، وبعض المتغيرات الكمية للغاية من 7B)مع ذلك، ستلاحظ بعض القيود، خاصةً إذا كان النظام والمتصفح يستهلكان بالفعل قدراً كبيراً من الذاكرة. من المرجح أن يعمل كل شيء ببطء أكبر وببطء ملحوظ.
- غيغابايت من ذاكرة الوصول العشوائي 16المعيار المعقول اليوم. مثالي لنماذج 7 مليارات وحتى 13 مليار التي تم تحديد كميتها في الربع الرابعخاصةً إذا كنت تستخدم وحدات معالجة الرسومات (GPUs). يمكنك العمل مع المحادثات المعقدة دون أن يتباطأ النظام.
- 32 غيغابايت من ذاكرة الوصول العشوائي أو أكثريُنصح به إذا كنت ترغب الموديلات المتوسطة (30B، 40B، 70B) أو القيام بأشياء أثقل مثل السياقات الطويلة جدًا، أو نماذج متعددة بالتوازي، أو خوادم متعددة المستخدمين، أو أدوات رسومية من نوع Open WebUI على Ollama.
تذكر أن ذاكرة الوصول العشوائي (RAM) لا يستخدمها الجهاز فقط، بل يستخدمها أيضًا نظام التشغيل، والمتصفح، وبيئة التطوير المتكاملة (IDE)، وDocker، وOpen WebUI، وغيرها من التطبيقات . إذا كنت ترغب في تحرير الذاكرة في حالات معينة، يمكنك معرفة كيفية تقليل استهلاك ذاكرة الوصول العشوائي في تطبيقات مثل متصفحك. للاستخدام المكثف، يُنصح حاليًا بـ 16 جيجابايت كحد أدنى، و32 جيجابايت كافية تمامًا.
وحدة المعالجة المركزية: تعليمات حديثة وعدد من النوى
يمكن تشغيل برنامج أولاما على وحدة المعالجة المركزية وحدها، لكن الأداء يختلف اختلافًا كبيرًا باختلاف نوع المعالج. والأهم من عدد النوى هو دعم التعليمات المتقدمة مثل AVX2، والأفضل من ذلك، AVX-512 ، التي تُسرّع عمليات المصفوفات والمتجهات المستخدمة بكثرة في نماذج التعلم المحدود.
يمكن أن تكون إحدى الإرشادات المعقولة هي:
- الحد الأدنى المقبولمعالج مركزي حديث رباعي النواة (على سبيل المثال، معالج Intel i5 من أحدث جيل أو معالج Ryzen مكافئ) يدعم تقنية AVX2. ستتمكن من قم بتشغيل نماذج 7B بصبر، خاصة إذا كانت مُكمّمة بشكل جيد..
- موصى بهأحدث أنواع المعالجات معالج Intel من الجيل الحادي عشر أو أحدث أو معالج AMD Zen4، مع 8 أنوية أو أكثر ودعم AVX-512 حيثما أمكن. بهذه الطريقة ستحصل على تحسين أوقات الاستجابة وتقليل الاختناقات، حتى مع وحدات معالجة الرسومات.
إذا كنت تخطط لاستخدام نماذج كبيرة جدًا (على سبيل المثال، تجربة نموذج Llama 3 بسعة 70 مليار مع معالج مركزي ووحدة معالجة رسومية متوسطة)، فسيعاني المعالج المركزي وستلاحظ أوقات توليد رموز طويلة جدًا . في هذه الحالات، يكون الحل الأمثل هو اختيار نماذج أصغر أو الاستثمار في وحدة معالجة رسومية مناسبة.
وحدة معالجة الرسومات وذاكرة الوصول العشوائي للفيديو: متى يكون ذلك ضرورياً وما مقداره المطلوب
ليست وحدة معالجة الرسومات (GPU) ضرورية، لكنها تُحدث فرقًا شاسعًا. فوحدة معالجة رسومات جيدة مزودة بذاكرة فيديو كافية قادرة على تحويل تجربة اللعب البطيئة إلى تجربة سلسة تمامًا ، خاصةً مع النماذج الكمية التي تتراوح بين 7 و13 مليار بكسل.
كمرجع مفيد للغاية ، بالنسبة للنماذج الكمية (تقريبًا Q4)، يمكن تقدير شيء كهذا:
- 7 بايت → ~4 جيجابايت من ذاكرة الوصول العشوائي للفيديو
- 13 بايت → ~8 جيجابايت من ذاكرة الوصول العشوائي للفيديو
- 30 بايت → ~16 جيجابايت من ذاكرة الوصول العشوائي للفيديو
- 65-70 مليار ← ~32 جيجابايت من ذاكرة الوصول العشوائي للفيديو
هذه قيم تقريبية، لكنها تُظهر بوضوح أن بطاقة رسومات RTX 2060 SUPER المزودة بذاكرة فيديو 8 جيجابايت قادرة على معالجة 7 بايت، ويمكنها التعامل مع 13 بايت، لكنها تعجز عن معالجة 70 بايت حتى مع معالج i9 وذاكرة وصول عشوائي 64 جيجابايت. في هذه الحالة، سيُضطر النظام إلى توزيع جزء كبير من الحمل بين ذاكرة الوصول العشوائي ووحدة المعالجة المركزية، مما سيؤدي إلى ارتفاع زمن الاستجابة بشكل كبير.
من الناحية العملية :
- مع 4-6 جيجابايت من ذاكرة الوصول العشوائي للفيديو: قم بالتركيز على نماذج 7B ذات كمية جيدةإنها فعالة للغاية في الدردشة والكتابة والمهام العامة.
- مع 8-12 جيجابايت من ذاكرة الوصول العشوائي للفيديويمكنك العمل بشكل مريح مع 7ب و 13ب وحتى بعض مسارات 30B إذا كنت على استعداد للسير ببطء أكثر قليلاً.
- مع 20-24 جيجابايت من ذاكرة الوصول العشوائي للفيديوأنت الآن تدخل منطقة طرازات 30B-40B تتمتع بقدر كبير من الكرامةوبعض وحدات 70B عالية التكميم، خاصة إذا كنت تدعمها بذاكرة وصول عشوائي جيدة.
- مع 32 جيجابايت من VRAM أو أكثر: هو عندما يبدو مبلغ 70B معقولاً حقاً للاستخدام التفاعلي، بشرط أن يرافق باقي أعضاء الفريق.
بالنسبة لنموذج التعرف الضوئي على الأحرف (OCR) أو النماذج المتخصصة الأخرى (مثل نماذج الرؤية الحاسوبية)، تُعدّ وحدة معالجة الرسومات (GPU) المزودة بذاكرة وصول عشوائي للفيديو (VRAM) بسعة 20-24 جيجابايت أساسًا متينًا لأداء سلس ، خاصةً إذا كان النموذج يتضمن عشرات المليارات من المعاملات. أما بالنسبة لنماذج التعرف الضوئي على الأحرف أو نماذج الرؤية الحاسوبية الأخف وزنًا (2-7 مليار)، فإن 8-12 جيجابايت كافية تمامًا.
مساحة التخزين على القرص: ما مقدار المساحة التي تشغلها النماذج؟
أما بالنسبة لمساحة القرص، فإن تطبيق أولاما نفسه لا يشغل سوى مساحة صغيرة جدًا؛ ما يشغل المساحة فعليًا هي النماذج. في بيئة أساسية أو تجريبية، تكفي مساحة 50 جيجابايت تقريبًا ، ولكن إذا بدأت في جمع النماذج، فستزداد المساحة بسرعة.
كدليل تقريبي للنماذج الكمية:
- نماذج صغيرة (1ب-4ب) → حول 2 جيجا بايت حسب النموذج.
- نماذج متوسطة الحجم (7ب-13ب) → عادةً 4 8-GB حسب النموذج وفقًا للقياس الكمي.
- نماذج كبيرة (30B-70B) → بسهولة 16 40-GB كل واحد.
- نماذج كبيرة جدًا (> 100 بايت) → يمكن أن يتجاوز 200 جيجا بايت حسب الطراز، بل وتتجاوز التيرابايت في بعض الحالات القصوى.
يُفضّل استخدام قرص SSD سريع (NVMe إن أمكن) لتحميل النماذج الأولية بسرعة أكبر. بالإضافة إلى ذلك، يتيح لك برنامج Ollama تغيير موقع تخزين النماذج باستخدام متغير البيئة OLLAMA_MODELS ، مما يسمح لك باستخدام قرص ثانوي ذي سعة كبيرة وتوفير مساحة على القرص الرئيسي. لمزيد من المعلومات حول سعة التخزين وأنواع الأقراص، راجع دليل أجهزة التخزين.
متطلبات محددة لتشغيل نماذج معينة باستخدام أولاما
على الرغم من أن لكل نموذج فروقه الدقيقة، إلا أنه مع النظام البيئي الحالي لـ Ollama، يمكن تقديم بعض الإرشادات الواضحة لفئات الاستخدام النموذجية: الدردشة العامة، والترميز، ونماذج الرؤية/التعرف الضوئي على الأحرف، والنماذج الضخمة من نوع 70B.
قوالب الدردشة العامة (لاما، ميسترال، جيما، كوين...)
بالنسبة للاستخدام النموذجي لـ "ChatGPT المحلي" مع نماذج متوسطة الحجم مثل Llama 3.x 7B/8B، وMistral 7B، وGemma 2B/7B، أو Qwen ، فإن الإعداد المعقول اليوم سيكون على النحو التالي:
- الحد الأدنى الموصى به:
- معالج رباعي النواة حديث مزود بتقنية AVX2.
- غيغابايت من ذاكرة الوصول العشوائي 16.
- لا يوجد معالج رسومات أو معالج رسومات أساسي بذاكرة فيديو 4-6 جيجابايت.
- قرص SSD بسعة 50 جيجابايت على الأقل للنظام + نموذج أو نموذجين.
- التكوين الأمثل لتوفير مساحة رأسية واسعة مع 7B-13B:
- وحدة معالجة مركزية بثمانية أنوية أو أكثر (معالجات i7/i9 الحديثة أو Ryzen 7/9).
- غيغابايت من ذاكرة الوصول العشوائي 32 إذا كنت ترغب في إبقاء العديد من الأمور مفتوحة.
- وحدة معالجة الرسومات مع 8-12 جيجابايت من ذاكرة الوصول العشوائي للفيديو (RTX 3060/3070 أو ما يعادلها، AMD RX 6700 أو أعلى، أو جهاز Mac مزود بـ M1/M2/M3 مستخدمة بشكل جيد).
- قرص SSD بسعة 1 تيرابايت إذا كنت ستجمع نماذج.
في هذه السيناريوهات، تعمل نماذج 7B مع التكميم Q4_K_M أو Q5_K_M بشكل جيد للغاية وتوفر جودة أكثر من كافية للاستخدام الشخصي، والتوثيق التقني، ومهام الدراسة، أو دعم الكتابة.
نماذج البرمجة (DeepSeek، CodeLlama، Code-oriented Phi)
عادةً ما يكون للنماذج المتخصصة في البرمجة احتياجات مماثلة لنماذج الدردشة العامة من نفس الحجم ، ولكن يُنصح بتخصيص هامش أكبر قليلاً في ذاكرة الوصول العشوائي (RAM) وذاكرة الفيديو (VRAM) إذا كنت ستستخدمها مع بيئة تطوير متكاملة ثقيلة والعديد من المشاريع المفتوحة.
على سبيل المثال، لاستخدام شيء مثل DeepSeek-Coder (7B-8B) أو CodeLlama بحجم مماثل في ظل الظروف المناسبة ، سيكون المزيج المعقول للغاية هو:
- وحدة المعالجة المركزية: معالجات حديثة بستة إلى ثمانية أنوية.
- غيغابايت من ذاكرة الوصول العشوائي 32 إذا كنت تعمل باستخدام أدوات متعددة في نفس الوقت (بيئة التطوير المتكاملة، متصفح ذو علامات تبويب، دوكر، إلخ).
- وحدة معالجة رسومات (GPU) بذاكرة فيديو (VRAM) لا تقل عن 8 جيجابايت لتحريك النموذج بسلاسة.
يعمل البرنامج أيضًا على أجهزة ذات قدرات أقل، ولكن ستلاحظ بطئًا في أوقات الاستجابة عند إنشاء أجزاء طويلة من التعليمات البرمجية أو إجراء تحليلات معقدة . أما بالنسبة للطرازات الصغيرة مثل Phi-4 Mini، فإن المتطلبات أقل بكثير، وتعمل بكفاءة حتى على أنظمة مزودة بذاكرة وصول عشوائي (RAM) سعتها 16 جيجابايت ووحدة معالجة رسومات (GPU) خفيفة الوزن.
نماذج الرؤية والتعرف الضوئي على الأحرف (مفتاح، نماذج التعرف الضوئي على الأحرف، متعددة الوسائط)
تُضيف النماذج التي تتمتع بقدرات معالجة الصور (الرؤية/التعرف الضوئي على الأحرف) مثل لاما أو الإصدارات متعددة الوسائط من لاما 3.x، بالإضافة إلى نماذج التعرف الضوئي على الأحرف الخاصة، طبقةً إضافية من التعقيد. فعلى مستوى الأجهزة، تقترب هذه النماذج من متطلبات نموذج نصي بنفس الحجم، ولكن مع ميزة أكبر تتمثل في استخدام وحدة معالجة الرسومات (GPU).
إذا كنا نتحدث عن نموذج OCR متوسط الحجم (لنفترض في نطاق 7-13 بايت) وتريد استخدامه محليًا بشكل مريح للتعرف على المستندات والصور الممسوحة ضوئيًا وما إلى ذلك، فمن المنطقي التفكير في شيء مثل:
- وحدة معالجة الرسومات (GPU) مزودة بذاكرة وصول عشوائي للفيديو (VRAM) بسعة 20-24 جيجابايت سواء كان النموذج كبيرًا حقًا أو إذا كنت ترغب في ترك جميع عمليات المعالجة تقريبًا على البطاقة.
- وحدة معالجة الرسومات (GPU) مزودة بذاكرة وصول عشوائي للفيديو (VRAM) بسعة 8-12 جيجابايت إذا اخترت متغيرات أخف وزناً ومُقاسة بشكل جيد، فسيستمر ذلك في العمل بشكل جيد طالما أنك لا تفرط في استخدام حجم الصورة أو السياقات الضخمة.
- 16 جيجا بايت كحد أدنى من ذاكرة الوصول العشوائي، على الرغم من أن سعة 32 جيجابايت توفر هامشًا مريحًا للغاية للاستخدام المكثف.
- معالج مركزي حديث بحيث لا يسبب اختناقًا عند تحميل وحدة معالجة الرسومات.
الإجابة المباشرة على السؤال المعتاد "هل يمكنني تشغيل نموذج OCR على وحدة معالجة رسومات (GPU) بذاكرة VRAM تتراوح بين 20 و24 جيجابايت؟" هي نعم، إنه نطاق ممتاز لنماذج الرؤية/OCR المتوسطة إلى الكبيرة في Ollama ، بشرط أن يكون لديك أيضًا ذاكرة وصول عشوائي (RAM) كافية ووحدة معالجة مركزية (CPU) جيدة.
نماذج عملاقة (لاما 3:70B وما شابهها)
محاولة تشغيل لعبة Llama 3 بحجم 70 كيلوبايت على نظام ويندوز باستخدام معالج مركزي قوي جدًا (على سبيل المثال، معالج i9 من الجيل الحادي عشر) وذاكرة وصول عشوائي (RAM) بسعة 64 جيجابايت، ولكن مع وحدة معالجة رسومات (GPU) مثل RTX 2060 SUPER بسعة 8 جيجابايت، هو مثال مثالي على "نعم، ولكن لا". قد يتم تحميل النموذج في النهاية، ولكن:
- جزء من النموذج لا يتناسب مع ذاكرة الوصول العشوائي للفيديو (VRAM) ويعتمد بشكل كبير على ذاكرة الوصول العشوائي (RAM).
- يتعين على وحدة المعالجة المركزية القيام بالكثير من أعمال الاستدلال.
- يرتفع الوقت اللازم لكل رمز بشكل كبير وتصبح التجربة غير قابلة للاستخدام عمليًا..
لكي يكون استخدام جهاز 70B منطقياً في البيئات المنزلية أو شبه الاحترافية، فأنت بحاجة، كحد أدنى ، إلى شيء من هذا القبيل:
- ذاكرة وصول عشوائي (RAM) بسعة 32 جيجابايت كحد أدنى، و64 جيجابايت إذا كنت ترغب في مساحة إضافية.
- وحدة معالجة رسومات (GPU) مزودة بذاكرة وصول عشوائي للفيديو (VRAM) لا تقل عن 24-32 جيجابايت لتحميل معظم النموذج بتكميم معقول (Q4_K_M أو ما شابه).
- معالج مركزي قوي عالي الأداء مزود بـ 8-16 نواة.
إذا لم تستوف هذه الأرقام، فمن العملي أكثر استخدام نماذج 7B-13B ذات التكميم الجيد، أو إذا كنت بحاجة حقًا إلى 70B للحصول على جودة عالية، ففكر في خادم متخصص (محلي أو في السحابة)، أو جهاز Mac قوي جدًا، أو عدة وحدات معالجة رسومات تعمل بالتوازي.
متطلبات تثبيت أولاما على خادم افتراضي خاص أو خادم
خيار شائع آخر هو تثبيت Ollama على خادم افتراضي خاص أو خادم مخصص والوصول إليه عبر واجهة برمجة التطبيقات أو واجهة الويب (على سبيل المثال، باستخدام Open WebUI). وهذا لا يتطلب موارد فحسب، بل يتطلب أيضًا نظام التشغيل والصلاحيات.
في الأدلة التي تقدمها شركات مثل Hostinger، يُوصى بالحد الأدنى من المتطلبات التالية لخادم افتراضي خاص (VPS) مُصمم خصيصًا لمنصة Ollama:
- ذاكرة الوصول العشوائي: الحد الأدنى 16 جيجابايت حتى لا تُرهق النماذج الصغيرة/المتوسطة النظام.
- وحدة المعالجة المركزية: 4-8 أنوية افتراضيةوذلك حسب حجم النماذج وعدد المستخدمين المتزامنين.
- مساحة التخزين: 12 جيجابايت كحد أدنىومع ذلك، من الناحية العملية، يُنصح بالاستهداف بسعة أكبر (50-100 جيجابايت) إذا كنت ستجرب عدة طرازات.
- OS:فوق كل شيء لينكس، مع تفضيل ل أوبونتو 22.04 أو أحدث، أو إصدار مستقر حديث من ديبيان.
- الوصول إلى صلاحيات الجذر أو صلاحيات sudo من أجل تثبيت التبعيات، وتكوين systemd، وما إلى ذلك.
إذا كان خادمك الافتراضي الخاص (VPS) مزودًا بمعالج رسومات NVIDIA، فستحتاج إلى تثبيت وتكوين CUDA أو مجموعة أدوات حاويات NVIDIA إذا كنت تستخدم Docker. أما مع معالجات AMD، فيُستخدم عادةً ROCm على نظام Linux، وبرامج تشغيل Adrenalin المناسبة على نظام Windows. في البيئات التي لا تحتوي على معالج رسومات، سيعتمد الخادم على وحدة المعالجة المركزية (CPU) وذاكرة الوصول العشوائي (RAM)، لذا لا تُهمل هذه الموارد؛ كما يمكنك إدارته عن بُعد عبر سطح المكتب البعيد إذا كنت بحاجة إلى واجهة رسومية.
سيناريوهات الأجهزة المحددة والنماذج التي يجب استخدامها
ولضمان عدم بقاء كل ما سبق نظريًا بحتًا، قد يكون من المفيد إلقاء نظرة على بعض تركيبات الأجهزة النموذجية وأنواع النماذج التي تتناسب جيدًا في كل حالة باستخدام Ollama.
جهاز كمبيوتر مكتبي متوسط أو جهاز كمبيوتر محمول متوسط الحجم
لنتخيل فريقًا نموذجيًا :
- معالج i5 أو Ryzen 5 من بضع سنوات مضت (4-6 أنوية).
- غيغابايت من ذاكرة الوصول العشوائي 16.
- وحدة معالجة رسومات مدمجة أو مخصصة بسعة 4 جيجابايت.
- قرص صلب SSD بسعة 512 جيجابايت.
في هذا السيناريو، فإن الشيء المنطقي الذي يجب فعله هو السعي إلى :
- نماذج كمية من 1 مليار إلى 3 مليارات (Gemma 2B، Phi-4 Mini، Llama 3.x 1B) لتحقيق أقصى قدر من السلاسة.
- 7 نماذج في الربع الرابع إذا كنت تقبل بوقت استجابة أطول قليلاً.
- استخدام Ollama مع طرفية، وإذا كنت تريد واجهة ويب، فافتح WebUI بعناية حتى لا تفرط في تحميل ذاكرة الوصول العشوائي (RAM).
يمكنك استخدام مساعدك النصي المحلي، وإعداد الملخصات، وإجراء بعض التحليلات ومهام البرمجة الخفيفة، لكنها ليست البيئة المثالية لنماذج 13B وما فوق.
معدات متوسطة إلى عالية الجودة تركز على الذكاء الاصطناعي المحلي
نحن نتحدث هنا عن نوع من أنواع أجهزة الكمبيوتر الشخصية :
- معالجات i7/i9 أو Ryzen 7/9 الحديثة، 8-16 نواة.
- غيغابايت من ذاكرة الوصول العشوائي 32.
- وحدة معالجة الرسومات (GPU) مزودة بذاكرة وصول عشوائي للفيديو (VRAM) بسعة 12-24 جيجابايت (RTX 4070/4080، 3090، 4090، أو ما يعادلها من AMD أو ما شابهها).
- محرك أقراص صلبة SSD بسعة 1-2 تيرابايت.
هذا التكوين يوسع نطاق الاحتمالات بشكل كبير :
- نماذج 7 مليارات - 13 مليار في الربع الرابع / الربع الخامس للدردشة، والبرمجة، وتحليل البيانات... مع أوقات استجابة جيدة جدًا.
- موديلات 30B والبعض 70B مُكمّم إذا كنت تقبل ببعض التأخير الإضافي.
- Modelos دي الرؤية/التعرف الضوئي على الأحرف متوسطة الحجم تستخدم وحدة معالجة الرسومات بشكل مكثف.
إنه نوع من الآلات التي يمكنك من خلالها إعداد بيئة ذكاء اصطناعي محلية جادة، مع نماذج متعددة، وواجهة ويب، وتكامل عبر REST API، وسير عمل احترافي دون الاعتماد على خدمات خارجية.
خادم أو محطة عمل "وحشية"
أما في أعلى المستويات فتوجد بيئات تحتوي على:
- عدة وحدات معالجة رسومية (GPUs) بسعة 24-48 جيجابايت من ذاكرة الوصول العشوائي للفيديو (VRAM) لكل منها، أو وحدة واحدة عالية الأداء.
- 64-128 جيجابايت من ذاكرة الوصول العشوائي.
- وحدات المعالجة المركزية ذات النوى المتعددة، مثل طرازات Threadripper أو Xeon الحديثة.
هنا تبدأ النماذج الضخمة (أكثر من 70 مليار دولار، أو ذات تكلفة تشغيلية عالية، أو تعتمد بشكل كبير على تقنيات الرؤية الحاسوبية، إلخ) في الظهور بشكل واقعي، حتى مع وجود العديد من المستخدمين المتزامنين أو عمليات التكامل المعقدة. من الواضح أن هذا السيناريو مكلف للغاية، ولكنه يتيح لك أيضًا امتلاك إمكانيات مشابهة لبعض واجهات برمجة التطبيقات التجارية، مع تحكم كامل في البيانات ضمن بنيتك التحتية الخاصة.
نصائح عملية لتحقيق أقصى استفادة من أجهزة أولاما الخاصة بك
إلى جانب شراء المزيد من ذاكرة الوصول العشوائي أو وحدة معالجة رسومات أفضل، هناك العديد من الممارسات التي تساعدك على تحقيق أقصى استفادة مما لديك بالفعل وتجنب المفاجآت عند تشغيل نماذج كبيرة باستخدام Ollama.
بدايةً، من المهم اختيار الطراز المناسب بناءً على الاستخدام المقصود : فلا جدوى من استخدام بطاقة رسومات 70B لكتابة رسائل بريد إلكتروني بسيطة بينما تكفي بطاقة 7B مضبوطة جيدًا. وبالمثل، لا يُنصح باستخدام بطاقة رسومات 30B إذا كانت ذاكرة الوصول العشوائي للفيديو (VRAM) في جهازك 6 جيجابايت فقط؛ ستكون بطاقة 7B خيارًا أفضل في الربع الأخير من العام.
من الإجراءات الرئيسية الأخرى تجربة معلمات وقت التشغيل (درجة الحرارة، عدد السياقات، عدد التنبؤات، إلخ)، سواء في ملف النموذج أو عبر واجهة سطر الأوامر/واجهة برمجة التطبيقات. استخدام سياقات كبيرة جدًا ( عدد سياقات 32 كيلوبايت أو أكثر ) مع ذاكرة وصول عشوائي أو ذاكرة فيديو محدودة سيؤدي إلى إبطاء النظام بأكمله دون تحقيق فائدة تُذكر في كثير من الحالات.
يوصى أيضا مراقبة النماذج التي تم تحميلها والمعالج المستخدم عليها باستخدام ollama psهناك ستتمكن من معرفة ما إذا كان النموذج يعمل بالفعل على وحدة معالجة الرسومات (GPU) أو وحدة المعالجة المركزية (CPU)، وما هو حجم البيانات التي تم تحميلها. اضبط المتغير. أولاما_ابقوا_على_الحياة يساعد ذلك النماذج على تفريغ الذاكرة عندما لا تكون قيد الاستخدام، وبالتالي تحرير الموارد.
وأخيرًا، تذكر أن التكميم هو حليفك : إن إنشاء متغيرات Q4_K_M أو Q5_K_M من نموذج FP16 الأصلي يسمح لك بالاستفادة من أجهزة أكثر تواضعًا مع فقدان في الجودة غالبًا ما يكون غير محسوس تقريبًا للاستخدام في العالم الحقيقي.
بعد دراسة كل هذا، يتضح جليًا أن Ollama ليست هي الجزء الأكثر تطلبًا، بل النماذج نفسها . إن فهم العلاقة بين الحجم، والتكميم، وذاكرة الوصول العشوائي (RAM)، وذاكرة الفيديو (VRAM) يُمكّنك من اختيار مزيج الأجهزة ونموذج التعلم المحدود (LLM) المناسب لاحتياجاتك: بدءًا من حاسوب محمول بذاكرة 16 جيجابايت يعمل بنظام 7B خفيف الوزن، وصولًا إلى محطة عمل مزودة بوحدة معالجة رسومات (GPU) بسعة 24 جيجابايت قادرة على التعامل مع نماذج الرؤية والتعرف الضوئي على الأحرف (OCR) القوية. من خلال ضبط التوقعات والمعايير بعناية، يُمكنك بسهولة تشغيل نظام ذكاء اصطناعي قوي وخاص على جهازك الخاص دون أي رسوم شهرية.