
多智能体编程系统 Token 消耗研究:代码审查吞掉近 60% Token,输入 Token 占 53%。AI 编程真成本不在写代码,而在反复审查验证。

Meta 披露超 2 万 Instagram 账户遭黑客利用 AI 客服漏洞劫持。攻击者只需“询问”聊天机器人,就能重置目标密码,实现完全账户接管。

pg_durable 是 Microsoft 开源的 PostgreSQL 持久化执行扩展,让 SQL 函数通过检查点机制在崩溃后自动恢复,无需外部服务或编排器。

通过排列检验与 Fisher 精确检验分析 rsync 引入 Claude 后的 bug 率,发现并无统计显著异常,版本落在历史分布正常范围内。

Google DeepMind 发布 Gemma 4 QAT 量化感知训练模型,通过 Q4_0 和移动端专用量化格式将 E2B 模型内存降至 1GB,大幅降低显存需求同时保留模型质量。

ScreenAI是Google DeepMind推出的视觉语言模型,仅5B参数就在UI和信息图表任务上达到SOTA。核心创新是屏幕标注任务结合LLM自动生成训练数据。

KVarN 是华为为 vLLM 开发的原生 KV-cache 量化后端。相比现有方案同时保留速度和精度,3-5x 容量,~1.3x 吞吐量,即插即用。

Anthropic 研究所报告:AI 自主任务时长从 4 分钟跃升至 12 小时,基准测试迅速饱和,递归自我改进或将加速到来。

多智能体辩论(Multi-Agent Debate)通过多个 LLM 实例互相批评优化推理,但成本极高。Latent Agents 提出两阶段微调方法,将多智能体辩论内化为单模型前向传播中的隐式过程,Token 消耗最高减少 93%,同时揭示了一种可解释的激活空间结构。

Transformer 的 QKV 三个投影是否都必要?研究发现 Q-K=V 仅损失 3.1% perplexity,即可实现 50% KV cache 缩减,对设备端推理部署有直接价值。