الانتقال إلى المحتوى

Insights · AI

RAG والحوكمة: ذكاء اصطناعي لا يخمّن

الإجابات الموثوقة تأتي من مصادرك، لا من تخمينات النموذج. الاسترجاع والقواعد والرقابة البشرية تقلّل المخاطر.

المشكلة

لماذا يختلق النموذج اللغوي، ولماذا لا يكفي أن نطلب منه ألا يفعل

النموذج لا يعرف، بل يتنبأ

النموذج اللغوي لا يرجع إلى أرشيف عندما يجيب: إنه يولّد سلسلة الكلمات الأكثر احتمالًا في السياق المعطى. وعندما يمسّ السؤال معلومات غير موجودة في بيانات تدريبه، أو تغيّرت بعد التدريب، فإن النموذج لا يتوقف ولا يقول «لا أعرف». بل يواصل إنتاج نص يبدو معقولًا، بنفس النبرة الواثقة التي يستخدمها مع إجابة صحيحة. هذه هي الآلية وراء ما يسمى الهلوسات: فهي ليست خطأ عرضيًا يُصلَح، بل السلوك الطبيعي لأداة تُحسِّن الطلاقة لا الحقيقة.

المعقول لا يعني الصحيح

أسوأ المخاطر ليس الإجابة الخاطئة بوضوح، التي تُكتشف فورًا. بل الإجابة القابلة للتصديق: مرجع تنظيمي لا وجود له، بند تعاقدي يُقتبس بثقة لكنه مختلَق، تاريخ أو رقم أُدرج لإكمال الجملة. في سياق الأعمال يحوّل هذا أداةً مفيدة إلى مصدر خطر تشغيلي وسمعي. ومطالبة النموذج بأن «يكون دقيقًا» لا تحل المشكلة، لأن النموذج لا يملك وسيلة للتمييز بين ما يتذكره وما يبنيه في اللحظة.

التحوّل الصحيح: من الذاكرة إلى المصدر

الإنجاز الحقيقي ليس اختيار نموذج أكبر، بل تغيير المكان الذي تأتي منه الإجابة. فبدلًا من ترك النموذج يستمد من ذاكرته الإحصائية، نقدّم له المادة ذات الصلة لحظة طرح السؤال ونطلب منه الإجابة على هذا الأساس فقط. يتوقف النموذج عن كونه الأرشيف ويصبح القارئ الذي يلخّص. هذه هي الفكرة الجذرية وراء RAG، التوليد المعزّز بالاسترجاع: استرجع أولًا، ثم ولّد.

كيف يعمل

الاسترجاع أولًا ثم التوليد: تشريح الإجابة الموثوقة

الاسترجاع

عندما يصل سؤال، لا يمرّره النظام مباشرة إلى النموذج. بل يبحث أولًا في مستنداتك — الصفحات والعقود والإجراءات وبطاقات المنتجات — عن المقاطع الأكثر صلة بذلك الطلب بعينه. مرحلة الاسترجاع هذه هي قلب الآلية: فإذا جلبت المادة الصحيحة كان للإجابة أساس؛ وإذا جلبت مادة غير دقيقة أو غائبة، فلن يستطيع أي نموذج التعويض. جودة الاسترجاع أهم من قوة النموذج.

التوليد المقيَّد

الآن فقط يدخل النموذج، ويتلقى تعليمات دقيقة: أجب مستخدمًا المقاطع المقدّمة حصرًا؛ وإن لم تكن المعلومة موجودة فقل ذلك. الفرق عن الاستخدام الحر واضح. لم يعد على النموذج أن يخمّن: عليه أن يقرأ ويختار ويعيد صياغة ما أمامه. موهبته اللغوية توضع في خدمة وثائقك، لا في خدمة خياله.

الاستشهاد بوصفه دليلًا

الإجابة الجادة تشير إلى مصدرها. كل ادعاء مهم ينبغي أن يكون قابلًا للتتبع إلى مقطع المستند الذي أُخذ منه، بحيث يستطيع أي شخص التحقق منه في ثوانٍ. الاستشهاد ليس تفصيلًا تجميليًا: إنه ما يجعل الإجابة قابلة للتدقيق. فبدون إمكانية التتبع تبقى حتى الإجابة الصحيحة فعلَ ثقة عمياء؛ ومع إمكانية التتبع تصبح عبارة قابلة للتحقق.

الروافع

أين ينخفض خطر الهلوسة فعليًا

01

حدود واضحة للمصادر

يجيب النظام فقط من مجموعة محددة ومحدَّثة من المستندات، لا من الويب بأكمله ولا من الذاكرة الداخلية للنموذج. تضييق نطاق المصادر هو الوسيلة الأولى لمنع انزلاق الإجابات نحو معلومات غير موثَّقة.

إجراء داخلي قديم يُسحب من الأرشيف فيتوقف فورًا عن تغذية الإجابات.
02

حق النموذج في قول «لا أعرف»

يجب توجيه الامتناع ومكافأته: عندما لا تحتوي المصادر على الإجابة، على النظام أن يصرّح بذلك بدل ملء الفراغ. عبارة «هذا غير موجود في المستندات المتاحة» أثمن من إجابة مختلَقة.

عند السؤال عن بند غير موجود، يجيب النظام بأنه لا يجده، بدل إعادة بنائه من الذاكرة.
03

تحديث المصادر لا إعادة التدريب

عندما تتغير سياسة ما، تُحدِّث المستند فتتغير الإجابة معه، دون المساس بالنموذج. هذا يُبقي النظام متوافقًا مع الواقع الحالي للشركة ويقلّل الإجابات المبنية على معلومات متجاوزة.

شرط إرجاع جديد يُنشر اليوم ينعكس بالفعل في إجابات الغد.
04

قابلية تتبع يمكن التحقق منها

كل إجابة تحمل معها مراجع مصادرها، ليتمكن القارئ من التحقق بنفسه. قابلية التحقق تحوّل الثقة العمياء إلى ثقة مستنيرة وتجعل من الممكن تصحيح النظام حين يخطئ.

بجانب إجابة تنظيمية يظهر رابط إلى المقطع الدقيق من النص المُستشهَد به.
النقطة الحساسة

الحوكمة والخصوصية واللائحة العامة لحماية البيانات: الاسترجاع الصحيح للشخص الصحيح

الاسترجاع لا يعني الكشف

منح النظام إمكانية الوصول إلى مستندات الشركة يطرح مسألة تحكّم: ليس كل ما يمكن استرجاعه ينبغي أن يكون قابلًا للاسترجاع من أي شخص. صلاحيات من يطرح السؤال يجب أن تسري أيضًا على الاسترجاع. لا ينبغي أن يتمكن أحد أعضاء الفريق من الحصول، عبر إجابة ملخَّصة، على معلومات لا يستطيع قراءتها بفتح المستند الأصلي. حوكمة الوصول ليست طبقة فوق النظام: إنها جزء من النظام.

البيانات الشخصية والتقليل منها

عندما تحتوي المصادر على بيانات شخصية، تنطبق مبادئ اللائحة العامة لحماية البيانات كما تنطبق على أي معالجة أخرى: الأساس القانوني، وتقليل البيانات، والغرض المحدد، والاحتفاظ المحدود. وهذا يعني أن تقرر بوعي ما يدخل في الأرشيف القابل للاسترجاع وما لا يدخل، وأن تتعامل مع الفئات الحساسة بعناية خاصة. السؤال ليس فقط «هل يجيب النظام جيدًا»، بل «هل يستخدم بيانات يحق له استخدامها، وللغرض الذي جُمعت من أجله».

السجلات والاحتفاظ والمساءلة

النظام المحكوم يترك أثرًا: أي مصادر استُشيرت، وأي إجابة قُدّمت، ومتى. هذا يخدم التحقق والتصحيح وإثبات الامتثال، لكنه بدوره يحتاج إلى ضبط، لأن السجلات أيضًا قد تحتوي على بيانات شخصية وتحتاج إلى سياسة احتفاظ. الحوكمة الناضجة لا تكتفي بجعل النظام يعمل: إنها تحدد من المسؤول عن ماذا، وإلى متى تبقى المعلومات متاحة.

كيف تفكر TMM

كيف تفكر TMM عند وضع نظام مرتكز على المصادر في الإنتاج

1
تحديد نطاق المصادر

قبل الحديث عن النماذج، يُقرَّر أي المستندات يمكن للنظام الاستناد إليها، ومن يملكها، وكم مرة تُحدَّث. النطاق الواضح هو المقدمة الضرورية لكل إجابة موثوقة.

2
رسم خريطة الصلاحيات والبيانات الشخصية

يُتحقَّق من يستطيع رؤية ماذا وأين توجد البيانات الشخصية، مع مواءمة وصول النظام مع الوصول الفعلي للأشخاص وتطبيق مبادئ تقليل البيانات منذ مرحلة التصميم.

3
فرض قيد المصادر

يُهيَّأ النظام ليجيب فقط من المادة المسترجَعة وليصرّح بغياب المعلومة عندما لا تكفي المصادر. ويُعامَل الامتناع بوصفه إجابة صحيحة، لا فشلًا.

4
وضع الإنسان في النقاط المهمة

في الحالات الأعلى تأثيرًا، تكون إجابة النظام مسودةً يراجعها شخص قبل أن تصبح نهائية. الرقابة البشرية لا تبطئ كل شيء: إنها تتركز حيث يكون الخطأ أبهظ كلفة.

5
القياس والتتبع والتصحيح

تُراقَب الإجابات الفعلية، ويُتحقَّق من الاستشهادات، وتُحدَّد نقاط ضعف الاسترجاع، ويُعمَل على المصادر. النظام يتحسن بتحديث المستندات، لا بملاحقة نماذج أكبر فأكبر.

مسار منظَّم، لا مفتاح يُضغط

الأسئلة الشائعة

أسئلة متكررة

هل يقضي RAG على الهلوسات تمامًا؟

لا، فهو يقلّلها بدرجة كبيرة لكنه لا يصفّرها. تثبيت النموذج على مصادرك يجعل الاختلاق أصعب بكثير ويجعل كل إجابة قابلة للتحقق، لكن هامش خطأ يبقى: فاسترجاع غير دقيق أو تلخيص متكلَّف قد ينتجان أخطاء. لهذا تهمّ الرقابة البشرية على الحالات الحرجة وإمكانية التحقق من الاستشهادات.

هل نحتاج إلى إعادة تدريب النموذج على بياناتنا؟

نادرًا جدًا، وهو نادرًا ما يكون أول ما يُفعل. في معظم الحالات يكون تقديم المستندات لحظة السؤال أكثر فاعلية وأمانًا: تُحدِّث مصدرًا فتتغير الإجابة، دون عمل على النموذج ودون دمج بياناتك بشكل دائم. وهو أيضًا نهج أكثر احترامًا للخصوصية، لأن البيانات تبقى في المصادر التي تتحكم بها.

ماذا يحدث إذا كان مستند ما خاطئًا أو قديمًا؟

سيجيب النظام وفقًا لذلك المستند، لأنه يثق بالمصادر التي تعطيه إياها. هذه هي النقطة المركزية: جودة الإجابات تعتمد على جودة الأرشيف وحداثته. لهذا فإن صيانة المصادر — سحب ما عفا عليه الزمن وتحديث ما يتغير — جزء لا يتجزأ من النظام وليست نشاطًا ثانويًا.

هل يمكننا التحكم في من يرى أي معلومات؟

نعم، وهو شرط لا خيار. يجب أن يحترم الاسترجاع صلاحيات من يسأل: لا ينبغي لأحد أن يحصل عبر إجابة على ما لا يستطيع قراءته مباشرة. ومع تقليل البيانات الشخصية وسياسة احتفاظ بالسجلات، هذا ما يجعل النظام متوافقًا مع اللائحة العامة لحماية البيانات ومع قواعدك الداخلية.

حوّل الفكرة إلى موجز