🧠 LHC-0 W4 — معمارية معرفية EN↔AR بلا طبقات متتالية

A cognitive-architecture EN↔AR system with zero stacked layers (depth via temporal recurrence only) — a contrastive translation encoder + knowledge memory + symbolic calculator + metacognitive confidence monitoring.

تسمية صادقة: أسماء المكوّنات (بروكا، فيرنيكه، الحُصين…) استعارات وظيفية تربط كل مكوّن بمنطقة معروفة في الشق الأيسر — وليست ادعاءً بيولوجيًا. اسم «ثنائي الشقين» يشير إلى تصميم الجسم الثفني (قناتان للمعالجة، Phase E) الذي يربط مسارَين؛ أما «الوعي» فنستخدم بدلاً منه «مراقبة معرفية» (metacognitive monitoring): وصول وظيفي لحالات النظام الداخلية — لا qualia ولا ادعاء بتجربة ذاتية إطلاقًا.


⚙️ ما الذي يفعله الكود فعليًا؟ (بالترتيب الذي ينفّذه)

  1. الاسترجاع هو مسار الإجابة: answer() = ترميز السؤال → جيب التمام مقابل الذاكرة → أعلى نتيجة (top-1). لا توليد نصوص.
  2. المرمّز: مصفوفة تباينية W: 32768×128 (≈4.2M وسيط) على ميزات مُجزّأة (hashed slot features) — مدرَّبة بـInfoNCE + تنافر الأشقاء على 3.6M زوج.
  3. الذاكرة: قاعدة معرفة 151KB (243 حقيقة) + استرجاع جيب تمام.
  4. الحاسبة: محلّل BODMAS رمزي مكتوب يدويًا (shunting-yard) — غير متعلَّم؛ «العمق» هنا = خطوات إجرائية متتابعة (تكرار مع ميزانية خطوات)، وليس حسابًا عصبيًا.
  5. الثقة (مراقبة معرفية): conf = ½·top1 + ½·gap (v3)، أو معايرة P1 (Platt على [top1, gap]) عند تمرير calibrator.
  6. وحدات مساعدة خارج مسار الإجابة: VSA (ربط رمزي في teach/augment)، المخيخ (متنبّئ خطي بقاعدة دلتا — تجربة Phase S)، الذاكرة العرضية والمساحة العالمية (W2/W3)، حلقة المراجعة (W4).

🏗️ خريطة التشريح (ملحق توضيحي — استعارة وظيفية)

المنطقة (الشق الأيسر) المكوّن يدخل مسار answer()؟
فيرنيكه/التلفيف الزاوي EngramMemory + Encoder ✅ (الاسترجاع)
العقد القاعدية kWTA (ترتيب top-k) ✅ (الاختيار)
ACC + vmPFC بوابة الثقة (top1+gap / P1) ✅ (القرار)
بروكا Articulator (إخراج الحروف) ✅ (النطق)
IPS/DLPFC الحاسبة + ذاكرة العمل ❌ (مسار compute)
الحُصين EpisodicMemory + الترسيخ ❌ (W2)
المهاد/الجبهي-الجداري GlobalWorkspace ❌ (W3)
الجسم الثفني BiCallosum (قناتان) ❌ (Phase E)
المخيخ متنبّئ خطي (delta-rule) ❌ (تجريبي)

📊 بيانات التدريب (3,605,197 زوجًا — 16 مجموعة)

الدلو المصادر الادعاء
A — عام NLLB 400K • UNPC 300K • CCMatrix 300K • CCAligned 150K • MultiUN 150K • wikimedia 100K • XLEnt 100K + المزيج الأصلي (TED2020/QED/News/Wiki/GV/TED2013/KDE4/WikiMatrix ≈ 2.1M) تعميم عابر للمجالات
B — كلاسيكي ATHAR 30K (عربية كلاسيكية) † استهداف مجال — موسوم صراحة
لا يُدرَّب أبدًا Tanzil • bible-uedin • NeuLab-TedTalks تقييم فقط (حارس آلي)

† ارتفاع Tanzil/Bible = تعميم عام + استهداف مجال — للتفكيك: LHC_W4_WITH_ATHAR=0. ومجال NeuLab-TED مرئي (عائلة TED في التدريب).

📐 منهجية التقييم (محدَّدة بالكامل الآن)

  • المهمة: twin-retrieval ثنائي الاتجاه (ar→en و en→ar): للجملة المصدر يُسترجع توأمها الحقيقي من بين 300 مرشح (التوأم + 299 مشتّتًا من نفس المجموعة).
  • العينة: n=300 لكل مجموعة (random.Random(41).sample)، PLUS مجموعة ALL (300 من دمج ≈60K). فواصل ويلسون 95% مذكورة لكل رقم.
  • تنظيف البيانات: phase_w1_data.download_corpus (نفس مسار التدريب).

📈 النتائج (n=300، المرشحون=300، seed=41)

المجموعة P2 (غير مدرَّب) ‡ W1 W4 ±95%
Tanzil † 0.000/0.013 0.123/0.140 0.230/0.247 ±0.048
Bible † 0.000/0.007 0.327/0.313 0.497/0.477 ±0.056
NeuLab-TED 0.010/0.003 0.813/0.817 0.917/0.903 ±0.032
ALL 0.007/0.007 0.420/0.430 0.590/0.610 ±0.056

‡ ملاحظة صريحة عن الأساس: P2 = مرمّز عشوائي غير مدرَّب (قريب من الصفر)، فالتحسينات النسبية (+87% إلخ) مضخَّمة بانحدار أرضي — الأرقام المطلقة هي المقياس الهادئ. (فوق = ar→en/en→ar.)

🆚 المرجع الخارجي (LaBSE + multilingual-e5-small) — نفس العينات والمرشحين

النموذج المعاملات Tanzil Bible NeuLab-TED ALL
LHC-0 W4 (هذا) 4.2M 0.230/0.247 0.497/0.477 0.917/0.903 0.590/0.610
LaBSE ~470M 0.667/0.847 0.973/1.000 0.980/0.990 0.857/0.923
multilingual-e5-small ~118M 0.413/0.340 0.803/0.863 0.930/0.973 0.680/0.673

فواصل ويلسون 95% (W4): Tanzil 0.186–0.281/0.201–0.298 • Bible 0.440–0.553/0.421–0.533 • TED 0.880–0.943/0.865–0.932 • ALL 0.534–0.644/0.554–0.663 LaBSE (ALL): 0.812–0.892/0.888–0.948 • e5-small (ALL): 0.625–0.730/0.618–0.724.

قراءة صادقة للجداول (مهمة):

  • الفجوة حقيقية: LaBSE يتفوّق بوضوح على كل المجموعات — المراجعة الخارجية كانت محقّة. على ALL نبلغ 69%/66% من LaBSE (0.59 مقابل 0.857)؛ وe5-small أعلى منّا في كل المقاييس الثمانية.
  • السياق الوحيد المخفّف (وليس دفاعًا): النموذجان مدرَّبان مسبقًا على تريليونات الرموز بلغات مئات — بينما مرمّزنا 4.2M وسيطًا بميزات مجزّأة بلا أي معرفة لغوية مسبقة (112× أصغر من LaBSE، 28× من e5-small). على مجال TED المتقارب نبلغ 94%/91% من LaBSE — الفجوة تتموّج بالمخزون اللغوي المسبق، وتتسع في Tanzil/Bible (العربية الكلاسيكية).
  • الخلاصة الهندسية: هذا مرمّز صغير مدمج + معمارية معرفية كاملة (ذاكرة، حاسبة، مراقبة معرفية، حلقة مراجعة) — وليس منافسًا لاسترجاع LaBSE. الرقم المرجعي محسوب بنفس العينات (n=300، المرشحون=300، seed=41) بواسطة run_baseline_eval.py المُضمَّن — ونتائجه في baseline_results.json.

🧪 اختبار مستقل ثانٍ (2026-10-01، Colab) — Tatoeba ar-eng

بروتوكول مختلف (عيّنة RandomState(0)، المرشحون = N، مطابقة argmax-الهوية) — تكرار مستقل من طرف ثالث على جمل قصيرة نظيفة:

النموذج N=300 N=1000 ثانية/1000 جملة (CPU)
LHC-0 W4 0.717/0.747 0.610/0.623 0.26–0.27
LaBSE 0.967/0.970 0.911/0.906 0.90–3.54
e5-small 0.887/0.893 0.799/0.788 0.62–0.92

(±95%: 0.717→0.663–0.765، 0.747→0.695–0.793، 0.610→0.579–0.640، 0.623→0.593–0.653). الخلاصة الثابتة: الفجوة الدلالية تحت LaBSE/e5 موجودة، لكن السرعة أقوى ميزة لنا: 3–13× أسرع من LaBSE و2–3× من e5-small على CPU — بمعاملات 4.2M فقط. وأثر حجم المرشحين واضح: 0.717 عند 300 مرشحًا ← 0.610 عند 1000.

الحواجز الواقية (W4): OOD-false@0.5 = 0.0 • novel-holdout = 1.0 • تكرار الصياغات = 1.0 • ECE = 0.026 • تغطية@95 = 0.762 • بوابة الترسيخ keep = 1.0 — و9/9 فحوص قبول W1 + 32/32 W4 + 30/30 W3 + 21/21 W2 + P2 ✓.

🎚️ الثقة (v3.1 — بعد المراجعة + اختبارات مستقلة)

  • المسار الافتراضي: conf = ½·top1 + ½·gap، الحدّ 0.45. الشواهد (مجموعتان مستقلتان، n=42 استعلامًا):
المجموعة min max عند thr=0.45
أسئلة موجودة في القاعدة (30) 0.709 0.903 30/30 تُجاب
أسئلة OOD واقعية (12) † 0.126 0.386 12/12 تُرفض
هراء عشوائي (25) 0.100 0.231 25/25 تُرفض
صياغات بديلة لأسئلة القاعدة (8) 0.127 0.587 5/8 تُرفض (رفض آمن «لا أعرف») ‡

† اختبار مستقل (2026-10-01): AUROC للميزتين top1 وgap = 1.0 على منفصل in-KB/OOD — الميزات ممتازة والحدّ هو نقطة التحكم. ‡ المفاضلة موثّقة: الحدّ المرتفع قد يرفض صياغة بديلة صحيحة (فشل آمن = امتناع)، بدلاً من إجابة واثقة خاطئة (فشل خطر) — فلسفة ACC «لا تخمين صامت». للتغيير: answer(q, conf_threshold=0.35) (يرفض 11/12 OOD)، أو المسار المعاير: LHC0(..., calibrator=ConfidenceCalibrator()) — Platt على [top1, gap] (ECE=0.026، OOD-false@0.5=0.0).

🧮 الحاسبة (v3 — بعد المراجعة)

رمزي مكتوب يدويًا (shunting-yard → RPN)، غير متعلَّم. الإصلاحات:

  • الكسور تعمل: 3.5 كانت تُقطَّع صامتًا إلى 3 — الآن 3.5.
  • قسمة حقيقية: 7/2 = 3.5 — كانت ترجع 3 صامتًا (floor).
  • حواجز DoS: أس ≤ 512، حجم نتيجة ≤ 4000 خانة، ميزانية خطوات 200K (9^99999999 → خطأ فوري؛ (10^18)/2 → خطأ صريح بدل التجمّد).
  • الحلقة التعليمية (جمع متكرر) للصغير فقط (≤10⁴) — 1000000/3 = 333333.33… يُحسب فورًا (كانت الحلقة تلتهم الميزانية حتى تُظهر قسمة صامتة).
  • تعبير مالوف = خطأ صريح (كان صامتًا — مثل 3.5+1 التي كانت تُعاد 3!).

🚀 الاستخدام

import numpy as np, json
from lhc_core import LHC0
from phase_c_encoder import TrainableEncoder
from phase_p2_slot import hashed_features_slot

z = np.load("phase_w1_W.npz")
enc = TrainableEncoder(F=int(z["F"]), d=int(z["d"]), tau=float(z["tau"]),
                       W=z["W"], features_fn=hashed_features_slot)
kb = json.load(open("knowledge_bank_superbrain.json", encoding="utf-8"))
brain = LHC0(kb=kb, encoder=enc)      # + calibrator=... للمسار المعاير

print(brain.answer("ما عاصمة مصر؟"))       # {'status':'ok', 'response':'القاهرة', ...}
print(brain.answer("هراء عشوائي xyz"))      # {'status':'uncertain', ...}
print(brain.compute("2^3+(5-3)*-4"))       # {'value': 0, 'steps': N}

⚠️ القيود الصادقة

  • ليس نموذجًا توليديًا — مرمّز استرجاعي + ذاكرة؛ لا يولّد نصوصًا حرة.
  • لا qualia — «مراقبة معرفية» وظيفية فقط (وصول لحالات داخلية معلَّنة).
  • تحسّن Tanzil/Bible مزيج تعميم + استهداف مجال (ATHAR) — وموسوم كذلك.
  • الأساس P2 غير مدرَّب (انظر ‡) — النِسَب النسبية مضخَّمة.
  • n=300 → فاصل ويلسون ±~5.6% عند p≈0.5 — فروق صغيرة ضمن الهامش.
  • التقييم استرجاع توائم (300 مرشحًا) — وليس ترجمة توليدية.

🧰 التحقق الذاتي (مُختبَر من طرف ثالث)

snapshot_download("sayed125/LHC-0-W4") ثم الأمثلة أعلاه تعمل كما هو موثّق: تحميل الأوزان، memory.read، compute، حدود الحاسبة، والمقارنة مع LaBSE/e5 — ونُشرت نتائجه المستقلة أعلاه.

📁 الملفات

phase_w1_W.npz (الأوزان) • lhc_core.py (النواة + الحاسبة) • phase_c_encoder.py / phase_p2_slot.py (الترميز) • phase_p1_reliability.py (المعايرة + البوابة) • phase_w2_episodic.py / phase_w3_workspace.py (العرضية/العالمية) • phase_w4_review.py (حلقة المراجعة) • app.py (Gradio) • knowledge_bank_superbrain.json • LHC0_PhaseW4_Kaggle.ipynb (الدفتر الكامل) • run_baseline_eval.py + baseline_results.json (المرجع الخارجي المقيس).

📜 الرخصة والبيانات

الكود والأوزان Apache-2.0. تحفظ: الأوزان مدرَّبة على مجموعات OPUS (تراخيصها متفاوتة — CCMatrix/CCAligned بشروط المشاع الإبداعي/البحثية، Tanzil بشروطه الخاصة) — استخدام الأوزان خارج نطاق البحث قد يستلزم مراجعة شروط المصدر. مجموعات التقييم (Tanzil/Bible/TED) لا تُعاد توزيعًا هنا — تُحمَّل من OPUS مباشرة في الدفتر.

English summary: LHC-0 W4 is a retrieval-based EN↔AR cognitive-architecture system — NOT an LLM: a 4.2M-param contrastive hashed-feature encoder (32768×128) trained on 3.6M filtered parallel pairs (evaluation corpora never trained on, machine-enforced), a 151KB knowledge memory, a hand-written symbolic BODMAS calculator (iterative steps with a step budget), and metacognitive confidence (top1+gap or P1-calibrated) — all with zero stacked layers. Twin-retrieval (300 candidates, n=300, seed=41): ALL 0.590/0.610, TED 0.917/0.903, Bible 0.497/0.477, Tanzil 0.230/0.247. Component names are functional metaphors for left-hemisphere regions; "bi-hemispheric" refers to the 2-channel callosum design. Honest limits: not generative, no qualia claims, ATHAR-targeted gains labeled, external baselines (LaBSE/e5) measured on identical samples.

التقرير التقني: sayed125/lhc-0-brain

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train sayed125/LHC-0-W4