[EINAI]كل المجلة
التفسيرية٨ دقائق

قراءة عقل النموذج

كيف تعلّم الباحثون أن يفكّكوا أفكار الشبكة العصبية المتشابكة إلى مفاهيم يمكن تسميتها، بل ورفعها أو خفضها.

النموذج المُدرَّب جدارٌ من الأرقام. لم يكتب أحدٌ مفاهيمه؛ بل استقرّت أثناء التدريب، مبثوثةً عبر ملايين الخلايا العصبية، بشيفرةٍ لم يخترها بشر. ولسنواتٍ كان ذلك آخر القصة: ترى ما يقوله النموذج، ولا ترى لماذا قاله.

التفسيرية الآلية (mechanistic interpretability) محاولةٌ لقراءة تلك الشيفرة من الداخل، لا بالتخمين من المخرجات، بل بتفكيك التنشيطات نفسها إلى أشياء نقدر على تسميتها. والاكتشاف الغريب الكامن وراءها أن الشبكة تخزّن من الأفكار أكثر بكثير مما تملك من خلايا، عبر تراكبها فيما يُسمّى التراكب (superposition).