معجم تعلُّم الآلة
كل مقياس ومفهوم يعرضه لك بيانِي، معرّفًا بلغة مبسّطة مع مثال عملي صغير. تتبع المصطلحات العربية معجم سدايا الرسمي للذكاء الاصطناعي.
لا توجد مصطلحات مطابقة.
المقاييس
R² (coefficient of determination)
مقدار ما يفسّره نموذجك من التباين في الهدف، مقارنةً بتخمين المتوسط دائمًا. القيمة 1.0 مثالية، و0 تعني أنه ليس أفضل من المتوسط، والقيمة السالبة تعني أنه أسوأ من المتوسط.
في مثال المنازل الخمسة في درس الانحدار، يبلغ R² للنموذج نحو 0.994 — أي أنه يفسّر 99.4% من الفروق بين أسعار المنازل.
MAE (mean absolute error)
متوسط الخطأ المطلقمتوسط حجم أخطاء النموذج، بوحدات الهدف نفسها. يتعامل مع خطأ كبير واحد وعدة أخطاء صغيرة بالطريقة نفسها ما دام مجموعها متساويًا.
أخطاء تنبؤ قدرها 0 و20,000 و0 و0 و20,000 ريال يبلغ متوسطها 8,000 ريال (MAE) — أي أن النموذج يخطئ بنحو هذا المقدار في الصف المعتاد.
RMSE (root mean squared error)
جذر متوسط الخطأ التربيعيمثل MAE، لكن كل خطأ يُربَّع قبل حساب المتوسط، لذا ترفعه الأخطاء الكبيرة القليلة بشدة. وهو دائمًا لا يقل عن MAE؛ والفجوة الواسعة بينهما تلمّح إلى أخطاء كبيرة متفرقة.
الأخطاء الخمسة نفسها تعطي RMSE يبلغ نحو 12,650 ريالًا — أعلى من MAE البالغ 8,000، لأن الخطأين البالغين 20,000 ريال يدخلان الحساب مربَّعين.
MSE (mean squared error)
متوسط الخطأ التربيعيمتوسط مربعات الأخطاء — أي RMSE قبل أخذ الجذر التربيعي. يرتّب النماذج بالطريقة نفسها التي يرتّبها بها RMSE لكنه يُقاس بوحدات مربّعة، ما يجعله أصعب في القراءة المباشرة.
أخطاء قدرها 0 و−20,000 و0 و0 و+20,000 ريال تعطي MSE يساوي 160,000,000؛ وجذره التربيعي هو RMSE.
MAPE (mean absolute percentage error)
متوسط الخطأ كنسبة مئوية من القيمة الحقيقية — «خطأ بنسبة 13% في الصف المعتاد». يسهل مقارنته بين سلاسل مختلفة، لكنه ينفجر عندما تقترب القيم الحقيقية من الصفر.
قيم فعلية 100 و200 و50 مقابل تنبؤات 110 و180 و60 تعطي أخطاء نسبتها 10% و10% و20% — أي MAPE يساوي 13.3%.
sMAPE (symmetric MAPE)
قريب متماثل من MAPE: يُقسَم كل خطأ على متوسط القيمتين الفعلية والمتنبأ بها بدلًا من الفعلية وحدها، ما يُبقي المقياس محدودًا عندما تقترب القيم الحقيقية من الصفر.
في الصفوف الثلاثة نفسها، يزن sMAPE كل خطأ مقابل متوسط الرقمين — فلا تستطيع قيمة فعلية قريبة من الصفر تضخيم المقياس.
Accuracy
دقةنسبة التنبؤات الصحيحة. بسيطة وبديهية، لكنها مضلِّلة عندما يهيمن صنف واحد — فالتنبؤ الدائم بالصنف الشائع قد يحقق درجة عالية دون أن يلتقط شيئًا.
أصاب نموذج فقدان العملاء في 8 من 10 عملاء اختبار — دقة 0.80.
Precision
إحكاممن بين كل التنبؤات الإيجابية التي قدّمها نموذجك، كم منها كان صحيحًا فعلاً؟ الإحكام العالي يعني إنذارات خاطئة أقل.
أشار النموذج إلى 4 عملاء مرجّح أن يغادروا، وغادر 3 منهم فعلًا — إحكام 3/4 = 0.75.
Recall
استدعاءمن بين كل الحالات الإيجابية الفعلية، كم منها التقطه نموذجك؟ الاستدعاء العالي يعني أنك لا تفوّت كثيرًا من الحالات الحقيقية.
غادر 4 عملاء فعلًا والتقط النموذج 3 منهم — استدعاء 3/4 = 0.75.
F1 score
نتيجة F1رقم واحد يوازن بين الإحكام والاستدعاء (متوسطهما التوافقي). مفيد عندما تهمّك الإنذارات الخاطئة والحالات الفائتة معًا.
إحكام 0.75 واستدعاء 0.75 يجتمعان في F1 يساوي 0.75؛ وإذا انخفض أحدهما انخفض F1 معه.
Balanced accuracy
الدقة المتوازنةمتوسط استدعاء كل صنف، بحيث يُحتسب الصنف النادر بقدر الصنف الشائع. فضِّله على الدقة العادية عندما تكون البيانات غير متوازنة.
استدعاء 0.75 للمغادرين ونحو 0.83 للباقين يعطيان دقة متوازنة تقارب 0.79.
ROC AUC
مساحة تحت منحنى دقّة الأداءاحتمال أن يرتّب النموذج حالة إيجابية مختارة عشوائيًا فوق حالة سلبية مختارة عشوائيًا. القيمة 1.0 ترتيب مثالي، و0.5 رمية عملة. يحكم على درجات النموذج، لا على إجابته النهائية بنعم/لا فقط.
قيمة AUC تساوي 0.90 تعني: اختر عشوائيًا عميلًا مغادرًا وآخر باقيًا، وفي 90% من الحالات يحصل المغادر على درجة الخطر الأعلى.
المفاهيم الأساسية
Model
نموذجمعادلة كتبها الحاسوب بدراسة بياناتك: تستقبل أعمدة الخصائص وتعيد تنبؤًا بالهدف. في بيانِي، يُحفظ النموذج الفائز ويكون جاهزًا للاستخدام من صفحة النماذج.
Training
تدريبعملية ملاءمة النموذج لبياناتك: خمّن، ثم قِس الخطأ، ثم عدّل، وكرّر حتى يتوقف الخطأ عن التقلص.
من 1,000 صف، يتعلّم بيانِي النمط من معظمها ويحتفظ ببعضها جانبًا لاختبار النتيجة بنزاهة.
Feature
خاصيةعمود إدخال يُسمح للنموذج باستخدامه عند التنبؤ — مثل المساحة أو المدينة أو العمر. ويمكن لبيانِي أيضًا بناء خصائص جديدة من أعمدتك، مثل تفكيك التواريخ إلى أجزاء.
لتوقّع سعر منزل، تُعد مساحته بالمتر المربع وحيّه من الخصائص.
Target column
العمود الهدفالعمود الذي تريد توقّعه — الإجابة التي يتعلّم النموذج إنتاجها. يجب أن يكون معبأً في كل صف تدريب؛ وتملؤه التنبؤات للصفوف الجديدة.
Dataset
مجموعة البياناتجدول بياناتك — صف لكل مثال وعمود لكل سمة، يُرفع كملف CSV.
Regression
انحدارتوقّع رقم: سعر أو مدة أو كمية. يُحكم عليه بحجم الأخطاء (MAE وRMSE) وبمقياس R².
بمعرفة مساحة المنزل وموقعه، توقّع سعره بالريال.
Classification
تصنيفتوقّع صنف: نعم/لا، مغادرة/بقاء، أ/ب/ج. يُحكم عليه بالدقة والإحكام والاستدعاء وF1، وكلها تُقرأ من مصفوفة الدقة.
بمعرفة سجل العميل، توقّع ما إذا كان سيلغي اشتراكه الشهر القادم.
Forecasting
التنبؤ الزمنيتوقّع القيم المستقبلية لشيء يُقاس عبر الزمن، حيث يهم ترتيب الصفوف — مبيعات الشهر القادم، وطلب الأسبوع المقبل. يستخدم النموذج إزاحات من القيم الماضية ويتنبأ بأفقٍ قادم.
من سجل مبيعات يمتد 24 شهرًا، توقّع الأشهر الثلاثة القادمة.
Prediction
تنبؤإجابة النموذج عن صف لم يره من قبل — رقم في الانحدار، وصنف في التصنيف، وقيم مستقبلية في التنبؤ الزمني.
أعطِ النموذج منزلًا بمساحة 130 م² فيتوقع سعرًا قدره 530,000 ريال.
Overfitting
فرط التخصيصعندما يحفظ النموذج بيانات التدريب بدل تعلّم النمط — درجات ممتازة على بيانات رآها، ودرجات ضعيفة على بيانات جديدة. يتحوط بيانِي منه ببيانات اختبار محجوبة وبالتحقق التقاطعي.
طالب يحفظ إجابات الاختبارات السابقة يتفوق في كل اختبار تجريبي ويرسب في الاختبار الحقيقي.
Underfitting
فرط التعميمعندما يكون النموذج أبسط من أن يلتقط النمط الحقيقي — فيسجّل درجات ضعيفة على بيانات التدريب والبيانات الجديدة على حدّ سواء.
التنبؤ بأن «كل منزل يكلف 500,000 ريال» بغضّ النظر عن المساحة يفوّت النمط تمامًا.
Confusion matrix
مصفوفة الدقةجدول صغير يقارن التنبؤات بالواقع: إيجابيات صحيحة، وإيجابيات خاطئة، وسلبيات خاطئة، وسلبيات صحيحة. تُقرأ منه مباشرة الدقة والإحكام والاستدعاء.
ثلاثة مغادرين التُقطوا، وإنذار خاطئ واحد، ومغادر واحد فات النموذج، وخمس حالات «بقاء» صحيحة تملأ خلايا المصفوفة الأربع في درس التصنيف.
Cross-validation
تحقق تقاطعيبدلًا من اختبار واحد، تُقسَّم البيانات إلى عدة طيّات وتأخذ كل طيّة دورها كمجموعة اختبار؛ ثم يُحسب متوسط الدرجات. يستخدمه بيانِي حتى لا يكون النموذج الفائز محظوظًا في تقسيمة واحدة فحسب.
خمس طيّات تنتج خمس درجات؛ ومتوسطها يحسم لوحة الترتيب.
Hyperparameter
مُعامِل ضبطإعداد لعملية التعلّم نفسها — مثل العمق الذي يمكن أن تبلغه الشجرة — يُختار قبل التدريب ولا يُتعلَّم من البيانات. يضبطه بيانِي تلقائيًا لأفضل النماذج.
تجربة عمق شجرة 4 مقابل 8 والاحتفاظ بالأفضل في التحقق التقاطعي.
Lags
الإزاحاتقيم ماضية من السلسلة الزمنية تُستخدم كمدخلات عند التنبؤ. مع 3 إزاحات، يتنبأ النموذج بكل شهر من الأشهر الثلاثة السابقة.
المدخلات [أغسطس 150، سبتمبر 145، أكتوبر 160] هي الإزاحات الثلاث المستخدمة لتوقّع نوفمبر.
Forecast horizon
أفق التنبؤمدى امتداد التوقع نحو المستقبل، مقيسًا بخطوات زمنية. يتنبأ بيانِي خطوة واحدة في كل مرة ويعيد كل إجابة إلى المدخلات — لذا كلما بعُدت الخطوة زاد ما تحمله من عدم اليقين.
أفق يساوي 3 على مبيعات شهرية يعني توقعات للأشهر الثلاثة القادمة.
Data leakage
تسرُّب البياناتعندما تتسلل إلى التدريب معلومات لن تكون موجودة وقت التنبؤ — مثل عمود سُجّل بعد وقوع النتيجة. يضخّم الدرجات أثناء التدريب وينهار في الاستخدام الفعلي؛ وترصُد فحوصات بيانِي التسريبات المحتملة.
عمود «تم ردّ المبلغ» يطابق تقريبًا عمود «أُلغي الطلب» — استخدامه لتوقّع الإلغاءات تسرُّب.
Class imbalance
عدم توازن الأصنافعندما يفوق عدد أحد الأصناف غيره بفارق كبير — مثلًا 95 عميلًا يبقون مقابل 5 يغادرون. تصبح الدقة العادية مضلِّلة؛ ويطبّق بيانِي أوزان أصناف متوازنة ويعرض الدقة المتوازنة.
نموذج يتنبأ دائمًا بـ«البقاء» يسجّل دقة 95% على تلك البيانات دون أن يلتقط مغادرًا واحدًا.
Outlier
قيمة شاذةقيمة بعيدة كثيرًا عن النطاق المعتاد — «منزل» بمساحة 10,000 م²، أو عمر يبلغ 300. قليل من القيم الشاذة قد يحرف المتوسطات والنماذج عن مسارها؛ ويرصُد تقرير مجموعة البيانات القيم المشتبه بها.
في عمود رواتب قيمه بين 4,000 و6,000 ريال، صفٌّ بقيمة 4,000,000 ريال قيمة شاذة — ولعلها خطأ كتابي.