- SmolVLM-256M: نموذج رؤية-لغة مكون من 256 مليون معلمة، مُحسَّن للأجهزة ذات الموارد المحدودة وقابلية النقل.
- بنية مع مشفر SigLIP قائم على patch-16/512 (93 مليون معلمة) وضغط الرموز المميزة للحصول على دقة واستقرار أعلى أثناء التدريب.
- قدرات متعددة الوسائط: أوصاف الصور، والاستعلامات عن المستندات، وتحليل الرسوم البيانية، وهي مفيدة في التعليم والشركات ذات الطاقة المنخفضة.
برز نموذج SmolVLM-256M بقوة في عالم الذكاء الاصطناعي كأكثر نماذج معالجة اللغة المرئية (VLM) صغراً حتى الآن. وقد طورته شركة Hugging Face ، ويهدف هذا النموذج إلى أن يكون عالي الكفاءة وسهل الاستخدام، حتى للأجهزة ذات الموارد الحاسوبية المحدودة. صُمم هذا النموذج مع مراعاة سهولة الحمل والأداء العالي، ويَعِد بإحداث ثورة في كيفية تفاعلنا مع الذكاء الاصطناعي، سواء على الأجهزة الشخصية أو في تطبيقات المؤسسات.
من أبرز مزايا معالج SmolVLM-256M صغر حجمه. فبفضل 256 مليون مُعامل فقط ، يستطيع هذا النموذج أداء مهام معقدة مثل إنشاء أوصاف للصور، وتحليل مقاطع الفيديو القصيرة، والإجابة على استفسارات حول ملفات PDF. ولا يقتصر هذا النهج على تحسين استخدام موارد الجهاز فحسب، بل يسمح أيضاً باستخدامه على أجهزة بسيطة كأجهزة الكمبيوتر المحمولة التي لا تتجاوز سعتها 1 جيجابايت من ذاكرة الوصول العشوائي (RAM).
أبرز الميزات التقنية

يكمن سر نجاح SmolVLM في بنيته المُحسّنة. فهو يستخدم مُشفّرًا بصريًا يُسمى SigLIP base patch-16/512 ، والذي يضم 93 مليون مُعامل . هذا المُشفّر ليس أصغر حجمًا بكثير من سابقه الذي كان يحتوي على 400 مليون مُعامل فحسب ، بل إنه يُحسّن أيضًا دقة الصور المُعالجة. وقد استُلهم هذا التغيير من أبحاث سابقة أجرتها شركتا Apple و Google ، والتي أثبتت أن زيادة الدقة البصرية تُحسّن الفهم بشكل ملحوظ دون زيادة حجم النموذج.
علاوة على ذلك، يستخدم SmolVLM تقنيات ضغط متقدمة للرموز، مما يسمح بتمثيل الصور بكفاءة أكبر. على سبيل المثال، يتم الآن تمثيل فواصل الصور الفرعية برمز واحد، بدلاً من رموز متعددة، مما ساهم في زيادة الاستقرار وتحسين الجودة أثناء تدريب النموذج.
قدرات الوسائط المتعددة

من بين وظائف SmolVLM مهام مثل:
- أوصاف الصورة: مثالي للتطبيقات التي تتطلب مقدمة بصرية مفصلة، مثل الأدوات التعليمية أو التجارة الإلكترونية.
- الإجابة على الأسئلة المتعلقة بالوثائق: من مستندات PDF إلى النصوص الممسوح ضوئيًا، يقوم النموذج بتحديد المحتوى المرئي والنصي وتحليله.
- تحليل الرسوم البيانية والمخططات: الحل الرئيسي للشركات التي تعمل مع البيانات المرئية المعقدة.
تجعل هذه الميزات هذا النموذج مثاليًا للمشاريع مثل تحسين المستندات والتفكير البصري الأساسي، وخاصة في المجالات التعليمية وبيئات العمل.
الاستخدامات العملية والتحسين

أطلقت شركة Hugging Face برنامج SmolVLM بهدف تحسين التكاليف . فعلى سبيل المثال، يمكن للشركات التي تتعامل مع كميات كبيرة من البيانات المرئية الاستفادة من انخفاض استهلاك هذا النموذج للموارد . إذ يُمكن أن تُحقق معالجة ما يصل إلى مليون صورة شهريًا باستخدام SmolVLM وفورات كبيرة مقارنةً بالنماذج التقليدية الأكبر حجمًا.
علاوة على ذلك، قامت شركات مثل IBM بدمج هذا النموذج في تطبيقات مثل Docling ، وهو برنامج لمعالجة المستندات. والنتيجة هي زيادة كفاءة إدارة البيانات، وخفض تكاليف التشغيل، وتعزيز القدرة التنافسية في السوق.
التدريب والبيانات المستخدمة
تم تدريب النموذج باستخدام مجموعتي بيانات رئيسيتين: ذا كولدرون ودوكماتيكس . تضم ذا كولدرون أكثر من 50 مجموعة بيانات عالية الجودة تجمع بين الصور والنصوص، بينما تركز دوكماتيكس على المستندات الممسوحة ضوئيًا وشروحها. وقد مكّن هذا النهج من تحسين النموذج لمهام محددة مثل تحليل المستندات ووصف الصور.
أُعطيت الأولوية أيضاً لمهام مثل فهم الرسوم البيانية العلمية وتحليل الرياضيات الأساسية. ورغم أن أداءه متميز في المهام متعددة الوسائط، إلا أنه من المهم ملاحظة أن النماذج الأكبر حجماً لا تزال تتفوق على SmolVLM في مسائل الاستدلال المتقدمة.
القيود والتحديات

على الرغم من مزاياها العديدة، فإنّ نموذج SmolVLM لا يخلو من بعض القيود . فقد أظهرت دراسات حديثة أنّ النماذج الصغيرة، مثل هذا النموذج، تميل إلى مواجهة صعوبة في الاستدلال المنطقي المعقد. ويعود ذلك إلى أنّها، على الرغم من قدرتها على تمييز الأنماط السطحية في البيانات، غالباً ما تفشل في تطبيق تلك المعرفة في سياقات جديدة.
علاوة على ذلك، في حين أن استهلاكها المنخفض للطاقة في الأجهزة يعد نقطة قوة، إلا أنه لا يجعلها مناسبة للمواقف المعقدة للغاية التي تتطلب معالجة مفصلة ودقيقة، مثل البحث المتقدم أو التطبيقات العلمية المحددة.
يمثل SmolVLM-256M حلاً مبتكرًا وسهل الوصول إليه لأولئك الذين يتطلعون إلى تنفيذ الذكاء الاصطناعي على الأجهزة ذات الموارد المحدودة. إن الجمع بين القدرات المتعددة الوسائط والكفاءة الحسابية والمرونة يجعلها خيارًا جذابًا للمطورين والمؤسسات على حد سواء. بفضل هذه التطورات، يثبت Hugging Face أن مستقبل الذكاء الاصطناعي لا يكمن فقط في النماذج الكبيرة والمعقدة، ولكن أيضًا في الهياكل الصغيرة والفعالة التي تجعل الوصول إلى هذه التكنولوجيا ديمقراطيًا.