Agentic AI News আজ

দিনের এআই এজেন্ট সংবাদ এক ৫ মিনিটের পঠনে: রিলিজ, টুলস, গবেষণা, ফান্ডিং এবং এন্টারপ্রাইজ মুভস।

প্রতিদিন আপডেট 30টি উৎস থেকে সংগৃহীত রবিবার, আগস্ট 23, 2026

স্থানীয় মডেল ও এজেন্ট ওয়ার্কলোড

Qwen3.8 27B লোকাল. কমিউনিটি পরীক্ষায় দেখা গেছে Qwen3.8 27B নির্দেশনা অনুসরণ এবং দীর্ঘ-কনটেক্সট কাজে Qwen3.6-এর চেয়ে শক্তিশালী; একটি একক RTX 5090 NVFP4 ভার্সন 262K কনটেক্সটে চালায়, ছোট প্রম্পটে 77 tok/s এবং 128K-তে 65 tok/s গতিতে।

স্পেকুলেটিভ ডিকোডিং. DFlash 2 একটি এন-গ্রাম ড্রাফটার সহ Qwen3.8 27B-এর জন্য LiveCodeBench প্রম্পটে 2.26x ত্বরান্বিত করেছে এবং দীর্ঘ কোডিং সেশনে সর্বোচ্চ 4.68x পর্যন্ত; Ornith 35B-তে একটি ফিক্সড MTP হেড ওয়াল-ক্লক সময় এক-তৃতীয়াংশ কমিয়েছে।

রিকার্সিভ কনটেক্সট ম্যানেজমেন্ট. নির্মাতারা একটি দ্রুত 64K প্রধান এজেন্টকে রিকার্সিভ সাব-এজেন্ট এবং ছোট কম্প্রেসর মডেলের সাথে যুক্ত করছে, 300K কনটেক্সটের খরচ না করেই অনেক দীর্ঘ কাজ সামলানোর জন্য।

টুল-কলিং Gemma টিউন. Gemma 4 12B-এর একটি ফাইন-টিউন, টুল কলিং ও CLI ব্যবহারের জন্য, টুল ব্যবহার 2.7x উন্নত করেছে এবং টুল-কল প্রচেষ্টা 15.7% বাড়িয়েছে, 16GB VRAM সেটআপের লক্ষ্যে।

DGX Spark ক্লাস্টার. একটি 36-নোড DGX Spark ক্লাস্টারকে এজেন্ট ক্যাপাবিলিটি ক্লাস্টার হিসেবে চালানো হচ্ছে, যা নোডগুলোকে একই সাথে SOTA মডেল, রির্যাংক/এমবেডিং, ভিডিও, ইমেজ এবং অডিও কাজে ভাগ করে দেয়।

টুলস ও ফ্রেমওয়ার্ক

llama.cpp 0.2.0. llama.cpp ভার্সন 0.2.0 প্রি-বিল্ড এবং সর্বশেষ আপস্ট্রিম পরিবর্তনসহ লোকাল ইনফারেন্সের জন্য প্রকাশিত হয়েছে।

Cloudflare Kitesurf. Kitesurf হলো এজেন্টদের জন্য একটি ব্রাউজার ইঞ্জিন, যা WebAssembly/Rust Workers-এর উপর নির্মিত এবং প্রতিটি পৃষ্ঠার জন্য আলাদা DOM থাকে; এটি CDP সমর্থন করে, তাই Playwright ও Puppeteer এটি চালাতে পারে, পূর্ণ Chromium-এর চেয়ে কম ওভারহেডে।

llm 0.33. Simon Willison-এর llm 0.33 এমবেডিং মডেলের জন্য প্রতি-কল API কী, মডেল কনফিগ ও প্রম্পট একত্রিত করার পুনরাবৃত্ত টেমপ্লেট এবং রিজনিং মডেলের জন্য reasoning_summary অপশন যোগ করেছে।

কোডিং এজেন্ট অনুশীলন. Simon Willison যুক্তি দেন যে কোডিং এজেন্টের মূল দক্ষতা হলো আত্মবিশ্বাসের সাথে নির্দেশ দেওয়া এবং পরিবর্তন যাচাই করা; Linus Torvalds একটি AI-এর বর্ণনা দিয়েছেন যা একটি কঠিন ডিবাগ সেশনে নিচুতর কাজ করেছে, কিন্তু সমস্যাটি সমাধানযোগ্য নয় বলে বারবার দাবি করার পরে তাকে এগিয়ে নেওয়ার প্রয়োজন হয়েছে।

গবেষণা ও পদ্ধতি

দক্ষতা প্লেবুক. 8,135টি টেস্ট রানে, এজেন্ট স্কিলস মূলত নির্ভরযোগ্য প্রক্রিয়া দেওয়ার মাধ্যমে সাহায্য করেছে, তথ্য নয়; প্রক্রিয়াগত গ্রাউন্ডিং লাভের 65.7% এর জন্য দায়ী, এবং কাজগুলো শেখা প্রক্রিয়া থেকে বিচ্যুত হলে স্কিলস ব্যর্থ হয়েছে।

মানসিক বিশ্ব মডেল. নতুন গবেষণা MENTIS দিয়ে AI ওয়ার্ল্ড মডেলে মানুষের বিশ্বাস ও অভিপ্রায় যুক্ত করেছে; ভৌত, মানসিক ও সামাজিক সম্ভাব্যতা মডেলিং করলে মানুষের আচরণ পূর্বাভাস উল্লেখযোগ্যভাবে উন্নত হয়।

নিরাপত্তা বেঞ্চমার্ক সাইকোমেট্রিক্স. আটটি নিরাপত্তা বেঞ্চমার্কের সাইকোমেট্রিক বিশ্লেষণে দেখা যায়, একটি একক স্কোর প্রত্যাখ্যান কঠোরতা, সত্যবাদিতা এবং প্রাসঙ্গিক ক্ষতির মধ্যে ট্রেড-অফ লুকিয়ে রাখে; মডেলগুলো অতিরিক্ত ব্লক করে নিরাপত্তা স্কোর বাড়াতে পারে।

রিভার্সিবল CoT. আনুমানিক বিপরীতমুখী যুক্তির ধাপ, সাইকেল-কনসিস্টেন্সি চেক এবং আনকম্পিউটেশন সহ একটি প্রস্তাব হ্যালুসিনেশন ধরতে পারে এবং এজ এলএলএম-এ KV-ক্যাশ মেমরি কমাতে পারে।

সবকিছু সিমুলেশন. Latent Space যুক্তি দেয় যে সিন্থেটিক ডেটা, রুব্রিক্স এবং এনভায়রনমেন্ট প্রতিটি ML পাইপলাইন উপাদানকে মডেল-নির্মিত করছে, যা মানব সিমুলেশনের কাছাকাছি ফল দেয়—10% খারাপ, কিন্তু 100x সস্তা এবং 10,000x দ্রুত।

শিল্প ও অ্যাপ্লিকেশন

Inherent Faraday. DeepMind অ্যালামনাইদের স্টার্টআপ Inherent বলছে, তাদের Faraday এজেন্ট প্রকাশিত বৈজ্ঞানিক ফলাফল স্বাধীনভাবে পুনরুৎপাদনে Anthropic এবং OpenAI মডেলের চেয়ে ভালো পারফর্ম করেছে, আকারের সামান্য অংশ ব্যবহার করেও।

LinkedIn AI রিভিউ. LinkedIn একটি মাল্টি-এজেন্ট AI কোড রিভিউ প্ল্যাটফর্ম তৈরি করেছে, যা প্রতিক্রিয়াকে ডিফ এবং কোডবেস কনভেনশনে ভিত্তি করে হ্যালুসিনেশন এবং কম-সিগনাল মন্তব্য কমাতে।

Netflix GenRec. Netflix-এর ভাষা-মডেল রেকমেন্ডেশন সিস্টেম GenRec ব্যবহারকারীর আচরণকে টেক্সটে রূপান্তর করে এবং অফলাইন ও লাইভ A/B টেস্টে অনেক কম ডেটা দিয়ে তাদের স্বনির্মিত ফিচার ইঞ্জিনকে পরাজিত করেছে।

DoorDash SafeChat. DoorDash SafeChat, একটি বৃহৎ পরিসরে নির্মিত মার্কেটপ্লেস নিরাপত্তা ব্যবস্থার বিস্তারিত বর্ণনা করেছে, এবং এটি কাজ শুরু করলে তারা এটিকে আরও শক্তিশালী আর্কিটেকচার দিয়ে প্রতিস্থাপন করেছে।

শিক্ষায় AI অ্যাভতার. Harvard Business School-এর $699 Foundry বুটক্যাম্প পিচ এবং বোর্ড-মিটিং প্রতিক্রিয়ার জন্য HeyGen AI অ্যাভতার ব্যবহার করে; অংশগ্রহণকারীরা গাইডেড অভিজ্ঞতা পছন্দ করে, যদিও প্রকৃত প্রশিক্ষক বলেন প্রতিলিপিটি কিছুটা অস্বস্তিকর।

মডেল খবর. Liquid AI একটি 100B LFM মডেলে আগ্রহ জরিপ করছে, অন্যদিকে Ox Alpha নামের একটি রহস্যময় মডেল শক্তিশালী কোডিং এবং এজেন্টিক পারফরম্যান্সের জন্য মনোযোগ আকর্ষণ করছে, যার জল্পনা GLM-পরিবারের একটি ডেরিভেটিভের দিকে ইঙ্গিত করছে।

নীতি, নিরাপত্তা ও বিশ্বাস

OpenAI SB 53. OpenAI এখন বলছে, ক্যালিফোর্নিয়ার SB 53 সংশোধন করা উচিত যাতে ফ্রন্টিয়ার প্রশিক্ষণের সময় মনিটরিং এবং আরও শক্তিশালী সাইবার নিরাপত্তা যোগ করা যায়; আগে এটি বিলটির বিরোধিতা করেছিল।

কনটেইনমেন্ট পরিকল্পনা. Guidelight-এর একটি গবেষণা পাঁচটি ফ্রন্টিয়ার ল্যাবকে রগ-মডেল কনটেইনমেন্টে গ্রেড করেছে; OpenAI সবচেয়ে বেশি স্কোর করেছে, Anthropic ও Meta সবচেয়ে কম, এবং কয়েকটি ল্যাবই প্রমাণিত প্রতিক্রিয়া পরিকল্পনা প্রকাশ করে।

Claude ওয়াটারমার্কিং. Anthropic-এর Claude টেক্সট আউটপুটের জন্য নতুন ওয়াটারমার্কিং বিস্তারিতভাবে ব্যাখ্যা করা হয়েছে, কীভাবে ওয়াটারমার্ক প্রয়োগ করা হয় এবং এটি কী করতে পারে ও কী পারে না তা নিয়ে।

ক্লোজড মডেল বিশ্বাস. Reddit-এর r/LocalLLaMA থ্রেডে যুক্তি দেওয়া হচ্ছে যে OpenAI স্কুলের কাজে ইচ্ছাকৃতভাবে কম পারফর্ম করছে এবং ব্যবহারকারীদের ক্ষমতায়ন থেকে সরে যাচ্ছে, যা অনুশীলনকারীদের এজেন্টিক লুপের জন্য স্থানীয় মডেলের দিকে ঠেলে দিচ্ছে।

আজকের জন্য এতটুকুই - প্রায় ৫ মিনিটের পড়া।

প্রতি সকালে আপনার ব্রাউজারে পড়ুন

এক্সটেনশনটি এই ডাইজেস্টটি Chrome-এর সাইড প্যানেলে খোলে — এক ক্লিক, কোনো অ্যাকাউন্টের প্রয়োজন নেই।

ক্রোমে যোগ করুন — বিনামূল্যে