Agentic AI News اليوم

أخبار وكلاء الذكاء الاصطناعي لهذا اليوم في قراءة مدتها 5 دقائق: الإصدارات والأدوات والأبحاث والتمويل والتحركات المؤسسية.

يُحدَّث يوميًا منتقاة من 30 مصادر الأحد, أغسطس 23, 2026

النماذج المحلية وأحمال عمل الوكلاء

Qwen3.8 27B محلي. تُظهر اختبارات المجتمع أن Qwen3.8 27B يتفوّق على Qwen3.6 في اتباع التعليمات والعمل بسياقات طويلة؛ وبطاقة RTX 5090 واحدة تُشغّل نسخة NVFP4 بسياق 262 ألف توكن بمعدل 77 توكنًا في الثانية للنصوص القصيرة و65 توكنًا في الثانية عند سياق 128 ألفًا.

فك الترميز التخميني. حقّق DFlash 2 مع نموذج مساعد n-gram تسريعًا بمقدار 2.26 مرة على أسئلة LiveCodeBench لنموذج Qwen3.8 27B، وصولًا إلى 4.68 مرة في جلسات البرمجة الطويلة؛ أما رأس MTP ثابت على Ornith 35B فقلّص زمن التنفيذ الإجمالي بمقدار الثلث.

إدارة السياق التكرارية. يجمع المطوّرون بين وكيل رئيسي سريع بسياق 64 ألفًا ووكلاء فرعيين متكررين ونماذج ضغط صغيرة للتعامل مع مهام أطول بكثير دون دفع تكلفة سياق 300 ألف.

ضبط Gemma لاستدعاء الأدوات. النسخة المضبوطة من Gemma 4 12B لاستدعاء الأدوات واستخدام CLI حسّنت استخدام الأدوات 2.7 مرة وزادت محاولات استدعاء الأدوات بنسبة 15.7%، وهي موجّهة لأنظمة ذاكرة رسومية بسعة 16 غيغابايت.

عنقود DGX Spark. يُستخدم عنقود DGX Spark من 36 عقدة كعنقود قدرات وكيلية، يوزّع العقد بين نماذج SOTA ومهام إعادة الترتيب/التضمين والفيديو والصور والصوت بالتزامن.

الأدوات والأطر

llama.cpp 0.2.0. أصدر مشروع llama.cpp الإصدار 0.2.0 ويتضمن بنى جاهزة وآخر التغييرات من المستودع الأصلي للاستدلال المحلي.

Cloudflare Kitesurf. Kitesurf محرّك متصفح مخصص للوكلاء مبني على WebAssembly/Rust Workers مع DOM معزول لكل صفحة؛ وهو يدعم بروتوكول CDP، ما يتيح لـ Playwright وPuppeteer التحكم به بتكلفة أقل من Chromium الكامل.

llm 0.33. أداة llm 0.33 من Simon Willison تضيف مفاتيح API لكل استدعاء لنماذج التضمين، وقوالب قابلة لإعادة الاستخدام لدمج إعدادات النماذج مع التلميحات، وخيارات reasoning_summary لنماذج الاستدلال.

ممارسة وكلاء البرمجة. يرى Simon Willison أن المهارة الأساسية لوكلاء البرمجة هي توجيه التغييرات والتحقق منها بثقة؛ أما Linus Torvalds فيصف ذكاءً اصطناعيًا أنجز الأعمال الروتينية الشاقّة في جلسة تصحيح أخطاء صعبة، لكنه احتاج إلى دفعه للأمام بعد أن أكّد مرارًا أن المشكلة غير قابلة للحل.

الأبحاث والمنهجيات

المهارات كدليل عمل. في 8,135 تجربة تشغيل، ساعدت مهارات الوكلاء بشكل أساسي عبر تقديم عمليات موثوقة لا حقائق؛ إذ مثّلت المعرفة الإجرائية 65.7% من المكتسبات، وفشلت المهارات عندما انحرفت المهام عن العملية المكتسبة.

نماذج العالم العقلية. يضيف بحث جديد المعتقدات والنوايا البشرية إلى نماذج العالم للذكاء الاصطناعي عبر نموذج MENTIS؛ إذ تعمل نمذجة المعقولية الجسدية والعقلية والاجتماعية على تحسين التنبؤ بالسلوك البشري بشكل ملحوظ.

القياس النفسي لمعايير السلامة. يكشف التحليل النفسي لثمانية معايير للسلامة أن درجة واحدة تخفي مفاضلات بين صرامة الرفض والصدق والضرر السياقي؛ ويمكن للنماذج تضخيم درجات السلامة عبر الإفراط في الحظر.

سلسلة التفكير العكسية. يقدّم الباحثون اقتراحًا لخطوات تفكير عكسية تقريبًا مع فحوصات تناسق دوري وفك حساب، قد يكشف الهلوسات ويقلل ذاكرة KV-cache في نماذج الحواف اللغوية.

محاكاة كل شيء. ترى نشرة Latent Space أن البيانات الاصطناعية وسلالم التقييم والبيئات تجعل كل مكوّن من خط أنابيب التعلم الآلي من صنع النماذج، لتقترب من محاكاة البشر بجودة أسوأ بنسبة 10% لكنها أرخص 100 مرة وأسرع 10,000 مرة.

الصناعة والتطبيقات

Inherent Faraday. تقول شركة Inherent الناشئة التي أسسها خريجو DeepMind إن وكيلها Faraday تفوق على نماذج Anthropic وOpenAI في إعادة إنتاج النتائج العلمية المنشورة بشكل مستقل، مع استخدام جزء بسيط من حجمها.

مراجعات LinkedIn بالذكاء الاصطناعي. بنَت LinkedIn منصة متعددة الوكلاء لمراجعة التعليمات البرمجية بالذكاء الاصطناعي، تستند في ملاحظاتها إلى الفروقات (diffs) وأعراف قاعدة التعليمات البرمجية لتقليل الهلوسات والتعليقات منخفضة القيمة.

Netflix GenRec. نظام التوصية المعتمد على نماذج اللغة من Netflix، GenRec، يحوّل سلوك المستخدم إلى نص وتفوّق على محرك الميزات المبني يدويًا في الاختبارات غير المتصلة واختبارات A/B المباشرة، مع بيانات أقل بكثير.

DoorDash SafeChat. وصفت DoorDash نظام SafeChat، الخاص بسلامة السوق، والمبني على نطاق واسع، ثم استبدلته ببنية أكثر قوة عندما بدأ يعمل.

أفاتار الذكاء الاصطناعي في التعليم. يستخدم معسكر Foundry التابع لكلية هارفارد للأعمال، بتكلفة 699 دولارًا، أفاتارات HeyGen للذكاء الاصطناعي لتقديم ملاحظات عن العروض التقديمية واجتماعات مجلس الإدارة؛ والمشاركون معجبون بالتجربة الموجّهة، رغم أن المدرب الحقيقي يقول إن المحتوى النصي مريب بعض الشيء.

أخبار النماذج. تستطلع Liquid AI الاهتمام بنموذج LFM بسعة 100 مليار معامل؛ بينما يجذب نموذج غامض اسمه Ox Alpha الانتباه بأداء قوي في البرمجة وفي المهام الوكيلية، مع تكهنات تشير إلى أنه مشتق من عائلة GLM.

السياسة والسلامة والثقة

OpenAI SB 53. تقول OpenAI الآن إن ولاية كاليفورنيا يجب أن تعدّل مشروع القانون SB 53 لإضافة مراقبة أثناء تدريب النماذج الحدودية وتعزيز الأمن السيبراني، بعد أن عارضت مشروع القانون سابقًا.

خطط الاحتواء. قيّمت دراسة من Guidelight خمسة مختبرات حديثة في مجال احتواء النماذج الخارجة عن السيطرة؛ فحصلت OpenAI على أعلى درجة، بينما جاءت Anthropic وMeta في أدنى الدرجات، وقلة من المختبرات تنشر خطط استجابة مُثبتة.

علامة Claude المائية. شرحٌ مفصّل للعلامة المائية الجديدة من Anthropic لمخرجات Claude النصية، يغطي كيفية تطبيقها وحدود قدراتها.

الثقة بالنماذج المغلقة. يجادل نقاش في منتدى r/LocalLLaMA على Reddit بأن OpenAI تتعمّد إضعاف أدائها في الواجبات الدراسية، وتبتعد عن تمكين المستخدمين، ما يدفع الممارسين إلى العودة إلى النماذج المحلية في حلقات الوكلاء.

هذا كل شيء لليوم - قراءة حوالي 5 دقائق.

اقرأه كل صباح، مباشرة في متصفحك

الملحق يفتح هذا الملخص في اللوحة الجانبية لـ Chrome — نقرة واحدة، بدون حساب.

أضف إلى Chrome — مجانًا