مقدمة إلى LLM
تقدم هذه الصفحة دليلاً بسيطاً حول النماذج اللغوية الكبيرة (LLM) من الأساسيات إلى التطبيقات للمهتمين بتقنيات الذكاء الاصطناعي.
الفصل 10 — أطر التقييم الرائدة
المقالة العاشرة من جولة LLM Primer III. دليل ميداني للأُطر التي تُحوِّل ثلاثية التقييم إلى شيءٍ يَستطيع الفريق فعلاً تَشغيله — RAGAS وTruLens وDeepEval من جهة، وBraintrust وLangSmith وPhoenix وGalileo وOpik من جهةٍ أخرى، وفجوة التقييم التي لم تَسدها أيٌّ منها بعد.
1447-10-08الفصل 9 — ثلاثية تقييم RAG
المقالة التاسعة من جولة LLM Primer III. نظام RAG يَستطيع الفشل في ثلاثة أماكن مختلفة، والإخفاقات تَبدو متطابقة من الخارج — ثلاثية التقييم لملاءمة السياق والإسناد وملاءمة الإجابة هي المفردات الصغيرة التي تَمنع إصلاح خطأٍ بينما تَقيس آخر.
1447-10-07الفصل 11 — التقييم والمعايرة والاستدلال
المقالة الحادية عشرة من جولة LLM Primer II. الفصل الذي نَسأل فيه كيف يُمكن قياس آلةٍ قادرةٍ على قول أيِّ شيء — ونَكتشف أنَّ النموذج الواثق كثيراً ما يَكون سيِّء المعايرة.
1447-09-24