مقدمة إلى LLM
تقدم هذه الصفحة دليلاً بسيطاً حول النماذج اللغوية الكبيرة (LLM) من الأساسيات إلى التطبيقات للمهتمين بتقنيات الذكاء الاصطناعي.
الفصل 10 — طبقة محرك LLM
المقالة العاشرة من جولة LLM Primer VI. vLLM كافتراضي Python-Native، وTensorRT-LLM يشتري الإنتاجية بخط بناء، وSGLang يفوز على أعباء الوكيل، وشجرة قرار بحسب شكل عبء العمل.
1447-11-15الفصل 8 — تحسين الأداء والتخديم والتكلفة
المقالة الأخيرة من جولة LLM Primer V. اقتصاديات LLM الإنتاجية بوصفها انضباطاً مُتعدد الطبقات — الاستدعاء الأرخص هو الذي لم يُجرَ (تخزين مؤقت دلالي)، والتالي هو المُجرى ضد أصغر نموذجٍ يفي بالغرض (مُوجِّه)، والأرضية تُوضع داخل خادم الاستدلال بـ KV cache والدُّفَعات المستمرة وفكّ الترميز التخميني.
1447-11-04الفصل 6 — قابلية الرصد والتتبع للذكاء الاصطناعي
المقالة السادسة من جولة LLM Primer V. اعتبار استعلام المستخدم شجرةً سببيةً لا سِجل طلبات، وما يجب تتبعه لتصير الشجرة مقروءة — اصطلاحات OpenTelemetry GenAI، وقياسات LLM، وخط الأنابيب الذي يُحوّل الآثار الإنتاجية إلى مجموعة تقييم الإصدار التالي.
1447-11-02الفصل 14 — المقارنة والاختبار والأداء
المقالة الخامسة عشرة والأخيرة من جولة LLM Primer IV. معيار MCP-Universe على خوادمٍ حقيقية، وضعيتا الفشل النظاميتان اللتان كَشَفهما، فجوة الإنتاجية بعشرة أضعاف بين الجلسة-لكل-طلب وبِرك الجلسات المُشتركة، والجسر إلى المُجَلَّد الخامس.
1447-10-24الفصل 5 — هندسة خط الاسترجاع
المقالة الخامسة من جولة LLM Primer III. لماذا ليس بحثٌ شعاعي واحد خطاً — الاسترجاع الهجين، دمج الرُّتب التبادلي، إعادة الترتيب بمُرمِّز متقاطع، وإعادة الصياغة من جهة الاستعلام وHyDE — مُجمَّعة في البنية الإنتاجية التي تَتقارب عليها أنظمة RAG الناضجة.
1447-10-03