Agentic AI News 今天

每日AI代理新闻,5分钟阅读:发布、工具、研究、融资和企业动态。

每日更新 来自 30 个来源的精选 星期日, 八月 30, 2026

智能体与模型发布

腾讯Hy4预览. 腾讯发布了Hy4预览版,相比Hy3体量大幅增加,默认启用高推理模式,并有no_think模式。社区已有约2.38比特的官方量化版本,以及约200GB的GGUF,据称可保留BF16约98%的性能。

本地推理与硬件

FlashMLA sm_120移植. 社区构建将FlashMLA扩展到消费级Blackwell sm_120 GPU,多个稀疏MLA负载的速度相比PyTorch SDPA提升2-3倍,FP8 KV缓存解码延迟降低8%。

Nemotron 16GB修复. Nemotron-3.5-Lightning的低比特GGUF因行宽量化实际约为4.70 bpw;修补后的llama.cpp构建可生成真正的3.07 bpw / 11.77 GiB文件,在16GB显存上运行262K上下文。

Qwen3.8-Flash-Next在Mac上. 一个79GB的2比特Qwen3.8-Flash-Next模型在128GB M5 Max上使用llama.cpp运行,配备350K上下文槽,包括对105K提示词进行333秒冷启动预填充,以及ngram-mod投机解码。

DeepSeek V4 Flash双GPU. 在2× DGX Spark/GX10配置上,DeepSeek V4 Flash 0731稳定达到67-84 tok/s,本地HumanEval Pass@1为94.5%,而GLM-5.3-Flash NVFP4为97.0%。GLM完成基准测试的时间大约只有前者的一半。

双5090上1M上下文. NInfer的一个分支增加了张量并行和YaRN ×4缩放,以便在双5090上运行Qwen3.8-27B NVFP4,上下文长度达1,048,576个token,在1M长度下以48-100 tok/s解码,并保持MTP接受率,而vLLM在此降至零。

16GB显存上的27B. 混合量化加上kvarn缓存设置,让Qwen3.8-27B在16GB RTX 4070 Ti SUPER上以50 tok/s的速度运行100K上下文,使用MTP投机解码和尾部精度KV缓存。

FreeToken MoE引擎. UC Berkeley和MIT的研究人员推出了FreeToken,这是一个开源引擎,可动态协同调度MoE专家传输,使前沿稀疏模型能在消费级GPU上解码,而不会因PCIe/RAM未命中而停顿。

基准测试与评估

Terminal Bench 4.0. Terminal Bench 4.0发布,刷新了排行榜,并聚焦快速迭代以应对饱和;GLM-5.3的得分在误差范围内达到Fable 5的水平。

金融基准披露. Ling-3.0-flash-Fin的基准卡片显示,智能体脚手架、工具和评估流程对报告结果的影响有多大;许多运行使用了ReAct配合网页搜索和Python,部分评估集是内部的或尚未公开。

研究与智能体基础设施

Google WikiSkill记忆. Google Research的WikiSkill为智能体提供了一个类似wiki的持久知识库,记录过去的失败与成功,并封装了可复用的Agent Skills,无需改变模型权重即可指导行为。

Anthropic模型硬件标准. Anthropic正在构建MHS,这是一个统一接口,让智能体控制显微镜和机械臂等物理设备;早期测试将多机器集成从数周缩短至数小时,但人工监督仍然必要。

智能体数据层. TOTVS的一场演示指出,事务型系统和数据湖并未针对耗token、对延迟敏感的智能体推理进行优化,并描述了数据访问向MCP和语义模型演进的方向。

LAION大型视频数据集. LAION发布了BVD,这是一个仅限研究使用的数据集,包含1000万小时视频、5500万个片段和3亿张静态图像,将视频、音频和文本关联起来。在其上训练的模型在一些基准上的得分比InternVid基线最多高出2.1个百分点。

行业与商业

索尼与华纳起诉Anthropic. Sony Music Publishing、Warner Chappell等出版商起诉Anthropic,指控其通过种子下载和抓取受版权保护的作品来训练Claude,并要求每部作品最高15万美元的赔偿。Anthropic表示将进行辩护。

OpenAI终止与Cursor合作. 在SpaceX收购Cursor后,OpenAI以Elon Musk旗下公司曾有违反合同的历史为由,终止与Cursor的合同。Anthropic回应称自己是更可靠的合作伙伴,并承诺继续为Cursor使用Claude提供算力。

Nvidia不止于GPU. Nvidia的财报叙事正从GPU份额转向数据中心编排和GPU周边系统。随着AI算力扩展到吉瓦级,Nvidia已在这一领域构建了最先进的网络和编排硬件。

今天的内容就这些 - 大约5分钟阅读。

每天早晨在浏览器中阅读

该扩展会在Chrome侧面板中打开此摘要——一键点击,无需账户。

添加到 Chrome — 免费