09/08/2026
https://www.facebook.com/share/p/1DY2mpgrpo/
عائلات نموذج Yolo
في البداية كان اسم YOLO يعني شيئًا واحدًا تقريبًا:
Object Detection.
صورة تدخل...
والنموذج يحدد:
أين يوجد الجسم؟
وما هو؟
لكن مع تطور الفكرة، لم يعد YOLO نموذجًا واحدًا فقط.
أصبح أقرب إلى "عائلة" من النماذج، وكل عائلة اتجهت إلى مشكلة مختلفة أو قدمت فلسفة مختلفة في السرعة، الدقة، التدريب، أو نوع المهمة.
وهنا يبدأ السؤال المهم:
إذا وجدت أمامك YOLOv8 وYOLO11 وYOLO26 وYOLO-World وYOLO-Seg وYOLO-Pose وغيرها...
فهل كلها تفعل الشيء نفسه؟
ليس تمامًا.
لفهم منظومة YOLO، لا تحفظ أسماء الإصدارات.
افهم أولًا: "ما المشكلة التي يحاول كل فرع من هذه المنظومة حلها؟"
━━━━━━━━━━━━━━━━━━
1. YOLOv5
━━━━━━━━━━━━━━━━━━
YOLOv5 أصبح من أكثر إصدارات YOLO انتشارًا في الاستخدام العملي، لأنه قدم توازنًا جيدًا بين:
Speed ↔ Accuracy ↔ Ease of Use
الفكرة هنا ليست أن النموذج يجب أن يكون الأكبر والأدق دائمًا.
بل:
"ما النموذج الذي يعطيني أداءً جيدًا بتكلفة معقولة؟"
ولهذا ظهرت أحجام متعددة مثل:
YOLOv5n
YOLOv5s
YOLOv5m
YOLOv5l
YOLOv5x
الحرف الأخير يعبّر عن حجم النموذج تقريبًا.
كلما اتجهت من Nano إلى X، تزداد القدرة الحسابية عادةً، وكذلك القدرة على تمثيل الأنماط المعقدة، لكن على حساب السرعة والموارد.
━━━━━━━━━━━━━━━━━━
2. YOLOv6
━━━━━━━━━━━━━━━━━━
هنا بدأ التركيز بشكل أكبر على الاستخدام الصناعي والـ deployment.
الفكرة الأساسية:
"كيف نحصل على Detector سريع وفعّال يمكن تشغيله في بيئات حقيقية؟"
أي أن التصميم لا ينظر إلى الدقة وحدها.
بل إلى:
Latency
Memory
Inference Speed
Deployment Efficiency
وهذا مهم لأن النموذج الذي يعمل جيدًا على GPU قوي ليس بالضرورة أفضل نموذج لكاميرا ذكية أو جهاز Edge.
━━━━━━━━━━━━━━━━━━
3. YOLOv7
━━━━━━━━━━━━━━━━━━
ركز YOLOv7 على تحسين كفاءة التدريب والأداء مع الحفاظ على سرعة الاستدلال.
وهنا ظهر درس مهم:
ليس المطلوب فقط أن نجعل الشبكة أكبر.
أحيانًا يمكن أن نحصل على مكاسب حقيقية من خلال تحسين طريقة تدريب الشبكة نفسها، وكيفية توزيع المعلومات داخلها.
━━━━━━━━━━━━━━━━━━
4. YOLOv8
━━━━━━━━━━━━━━━━━━
هنا بدأت منظومة YOLO تصبح أوسع بكثير.
لم يعد التفكير:
"أريد Object Detection فقط."
بل أصبح:
"أريد منصة رؤية حاسوبية يمكنها تنفيذ عدة مهام."
ولهذا ظهرت نماذج لمهام مثل:
Object Detection
Instance Segmentation
Classification
Pose Estimation
Oriented Bounding Boxes
وهذا التحول مهم جدًا.
لأن الصورة نفسها يمكن أن نطلب من النموذج التعامل معها بطرق مختلفة.
قد نريد:
"أين السيارة؟"
وهذا Detection.
أو:
"أي بكسلات تنتمي إلى السيارة؟"
وهذا Segmentation.
أو:
"أين مفاصل جسم الإنسان؟"
وهذا Pose Estimation.
أي أن السؤال تغير...
وليس مجرد النموذج.
━━━━━━━━━━━━━━━━━━
5. YOLOv9
━━━━━━━━━━━━━━━━━━
جاء YOLOv9 بفكرة مهمة تتعلق بكيفية انتقال المعلومات والتدرجات داخل الشبكة، مع تصميمات تهدف إلى تحسين كفاءة التعلم والأداء.
الفكرة التي تستحق التذكر هنا:
أحيانًا المشكلة ليست في كمية المعلومات التي تدخل الشبكة...
بل في:
"كمية المعلومات المفيدة التي تصل فعلًا إلى المكان الذي تحتاجها فيه."
━━━━━━━━━━━━━━━━━━
6. YOLOv10
━━━━━━━━━━━━━━━━━━
هنا بدأ التركيز بقوة على مفهوم:
End-to-End Object Detection.
أي محاولة تقليل الاعتماد على مراحل المعالجة اللاحقة وجعل عملية الكشف أكثر تكاملًا داخل النموذج.
وهذا الاتجاه مهم لأنه يقربنا من سؤال أكبر:
هل نستطيع جعل النموذج ينتج النتيجة النهائية مباشرة؟
بدل:
Prediction
→ Post-processing
→ Final Detection
نريد الاقتراب من:
Image
→ Model
→ Final Detection
وهذه الفكرة ستصبح أكثر وضوحًا مع YOLO26.
━━━━━━━━━━━━━━━━━━
7. YOLO11
━━━━━━━━━━━━━━━━━━
YOLO11 جاء كجيل أحدث من Ultralytics، مع تحسينات في البنية والتدريب والكفاءة، واستمر في دعم عدة مهام للرؤية الحاسوبية.
وهو مهم لأنه يمثل مرحلة ناضجة من فلسفة:
Accuracy + Speed + Efficiency + Multi-task Vision
لكن القصة لم تتوقف هنا.
لأن السؤال أصبح أكثر طموحًا:
"ماذا لو أعدنا تصميم رحلة النموذج من التدريب حتى النشر بالكامل؟"
وهنا نصل إلى YOLO26.
━━━━━━━━━━━━━━━━━━
8. YOLO26
━━━━━━━━━━━━━━━━━━
YOLO26 ليس مجرد رقم أكبر.
إنه يمثل فلسفة مختلفة في تصميم النموذج والنشر.
أحد أهم أفكاره:
Native End-to-End Inference.
في المسار الافتراضي يستخدم YOLO26 One-to-One Head، بحيث يستطيع إنتاج التنبؤات النهائية دون الحاجة إلى NMS كمرحلة لاحقة.
أي:
Traditional Pipeline:
Image
→ Network
→ Many Predictions
→ NMS
→ Final Detections
بينما المسار الافتراضي في YOLO26:
Image
→ Network
→ Final Detections
وهذا يجعل النموذج أبسط في الاستدلال والنشر.
كما أزال DFL من مسار Box Regression لتخفيف تعقيد الـ Detection Head، وأضاف تغييرات في وصفة التدريب مثل MuSGD وProgressive Loss وSTAL.
والأهم أن YOLO26 أصبح عائلة موحدة لمهام متعددة، تشمل Detection وSegmentation وDepth وClassification وPose وOBB، مع نسخ مخصصة لكل مهمة.
━━━━━━━━━━━━━━━━━━
9. YOLO-NAS
━━━━━━━━━━━━━━━━━━
هنا تظهر فكرة مختلفة تمامًا:
Neural Architecture Search.
بدل أن يعتمد الباحث على تصميم معماري يدوي بالكامل، يمكن استخدام البحث الآلي عن البنية للمساعدة في الوصول إلى توازن أفضل بين:
Accuracy
Speed
Model Size
أي أن السؤال يصبح:
"ما أفضل بنية يمكن اكتشافها لهذا النوع من القيود؟"
━━━━━━━━━━━━━━━━━━
10. YOLOX
━━━━━━━━━━━━━━━━━━
YOLOX قدم اتجاهًا مختلفًا داخل عائلة YOLO، ومن أبرز أفكاره:
Anchor-Free Detection
+
Decoupled Head
بدل الاعتماد على Anchors بالشكل التقليدي، يحاول النموذج التنبؤ مباشرة بطريقة أبسط.
وهذا يعكس اتجاهًا ظهر في عدة نماذج حديثة:
تقليل الافتراضات اليدوية داخل المعمارية.
━━━━━━━━━━━━━━━━━━
11. YOLO-World
━━━━━━━━━━━━━━━━━━
وهنا تحدث قفزة مفاهيمية جميلة.
YOLO التقليدي يتعلم مجموعة Classes محددة.
مثل:
Person
Car
Dog
Bus
لكن ماذا لو أردت أن تبحث عن شيء لم يكن موجودًا ضمن قائمة الفئات الأصلية؟
هنا تأتي فكرة:
Open-Vocabulary Detection.
بدل أن تقول للنموذج:
"اختر واحدة من هذه الفئات فقط."
يمكنك إعطاءه وصفًا نصيًا لما تبحث عنه.
مثل:
"red backpack"
أو:
"construction helmet"
أو:
"person wearing a safety vest"
ثم يحاول النموذج العثور على الأشياء المطابقة للوصف.
أي أن النموذج لم يعد مقيدًا بقائمة Classes ثابتة بنفس الطريقة.
وتدعم منظومة Ultralytics نماذج YOLO-World لهذا النوع من الكشف المفتوح المفردات.
━━━━━━━━━━━━━━━━━━
12. YOLO-Seg
━━━━━━━━━━━━━━━━━━
هنا ننتقل من السؤال:
"أين الجسم؟"
إلى سؤال أكثر دقة:
"أي بكسل بالضبط ينتمي إلى هذا الجسم؟"
لو كان لدينا ثلاث سيارات متداخلة، فإن Bounding Box يخبرنا بمربع تقريبي لكل سيارة.
لكن Instance Segmentation يعطي قناعًا Mask يحدد شكل كل كائن على مستوى البكسل.
وهذا مهم جدًا في:
Medical Imaging
Robotics
Autonomous Systems
Industrial Inspection
━━━━━━━━━━━━━━━━━━
13. YOLO-Pose
━━━━━━━━━━━━━━━━━━
الآن لم نعد نريد معرفة مكان الإنسان فقط.
نريد معرفة:
أين الرأس؟
أين الكتف؟
أين المرفق؟
أين اليد؟
أين الركبة؟
أين القدم؟
أي أن النموذج يتعامل مع:
Keypoints
ومن خلالها يمكن بناء Skeleton تقريبي للجسم.
وهذا يفتح الباب أمام:
Human Activity Recognition
Sports Analysis
Fitness Applications
Human-Computer Interaction
━━━━━━━━━━━━━━━━━━
14. YOLO-Face
━━━━━━━━━━━━━━━━━━
هنا يتم تخصيص النموذج لمشكلة أكثر تحديدًا:
Face Detection.
أي العثور على الوجوه داخل الصورة وتحديد مواقعها.
وهذا مثال مهم على فكرة:
"نفس فلسفة YOLO يمكن تخصيصها لمجال محدد بدل استخدام نموذج عام لكل شيء."
━━━━━━━━━━━━━━━━━━
15. YOLO-OBB
━━━━━━━━━━━━━━━━━━
في Object Detection التقليدي، يكون Bounding Box عادةً مستطيلًا أفقيًا:
x, y, width, height
لكن تخيل صورة جوية لسفينة مائلة بزاوية 37°.
الصندوق الأفقي سيحتوي مساحة كبيرة لا تنتمي إلى السفينة.
هنا نحتاج:
Oriented Bounding Box
أي Bounding Box يستطيع الدوران مع الجسم.
وهذا مهم جدًا في:
Aerial Images
Satellite Images
Remote Sensing
Document Analysis
━━━━━━━━━━━━━━━━━━
16. YOLO-Lite / Edge-Oriented Models
━━━━━━━━━━━━━━━━━━
ثم يظهر سؤال مختلف:
ماذا لو لم يكن لدي GPU قوي؟
ماذا لو أردت تشغيل النموذج على:
كاميرا ذكية؟
هاتف؟
Raspberry Pi؟
جهاز IoT؟
أو Edge Device؟
هنا تصبح الأولوية:
Small Model
Low Latency
Low Memory
Low Power
وليس:
"أكبر Accuracy ممكنة بأي تكلفة."
وهذا يوضح لماذا لا يوجد "أفضل YOLO" بشكل مطلق.
━━━━━━━━━━━━━━━━━━
إذن... كيف تختار؟
إذا كان هدفك:
Object Detection
→ ابدأ بعائلة Detection الحديثة مثل YOLO11 أو YOLO26.
إذا كنت تريد:
Pixel-level Object Understanding
→ Segmentation.
إذا كنت تريد:
Human Keypoints
→ Pose.
إذا كانت الأجسام:
مائلة أو ذات اتجاه واضح
→ OBB.
إذا كنت تريد:
البحث عن Objects باستخدام Text Prompts
→ Open-Vocabulary مثل YOLO-World / YOLOE.
إذا كان الجهاز:
ضعيفًا أو Edge Device
→ ابحث عن Nano / Small / Lightweight variants.
وإذا كان المطلوب:
أعلى دقة ممكنة
فستتجه عادةً إلى نموذج أكبر، لكنك ستدفع مقابل ذلك في:
Latency
Memory
Compute
Deployment Cost
وهنا تظهر القاعدة التي يجب ألا تنساها:
لا تختار YOLO بناءً على الرقم الموجود في اسمه.
اختره بناءً على:
Task + Data + Accuracy + Latency + Hardware + Deployment
━━━━━━━━━━━━━━━━━━
وهنا ربما تكون أهم فكرة في منظومة YOLO كلها:
لم تكن الرحلة من YOLOv5 إلى YOLO26 مجرد سلسلة من الأرقام.
كانت رحلة من سؤال بسيط:
"كيف نكتشف الأجسام بسرعة؟"
إلى أسئلة أكبر:
كيف نجعل الكشف أدق؟
كيف نجعله أسرع؟
كيف نجعل النموذج أخف؟
كيف نجعله يفهم أكثر من مهمة؟
كيف نجعله يتعامل مع أجسام لم يتعلم أسماءها مسبقًا؟
كيف نجعله يعمل على أجهزة ضعيفة؟
وكيف نجعله ينتج النتيجة النهائية مباشرة؟
ولهذا لا تنظر إلى YOLO كـ Model واحد.
انظر إليه كمنظومة من الأفكار.
كل فرع منها يحاول حل مشكلة مختلفة.
وفي النهاية، السؤال الصحيح ليس:
"ما أفضل YOLO؟"
بل:
"أي YOLO يحل مشكلتي بأفضل توازن بين الدقة والسرعة والتكلفة؟"
وهذه هي الطريقة التي تبدأ بها فعلًا في اختيار نموذج Computer Vision...
ليس بحفظ أسماء النماذج.
بل بفهم المشكلة التي صُمم كل نموذج لحلها.