
KVarN 是华为为 vLLM 开发的原生 KV-cache 量化后端。相比现有方案同时保留速度和精度,3-5x 容量,~1.3x 吞吐量,即插即用。

Anthropic 研究所报告:AI 自主任务时长从 4 分钟跃升至 12 小时,基准测试迅速饱和,递归自我改进或将加速到来。

多智能体辩论(Multi-Agent Debate)通过多个 LLM 实例互相批评优化推理,但成本极高。Latent Agents 提出两阶段微调方法,将多智能体辩论内化为单模型前向传播中的隐式过程,Token 消耗最高减少 93%,同时揭示了一种可解释的激活空间结构。

Transformer 的 QKV 三个投影是否都必要?研究发现 Q-K=V 仅损失 3.1% perplexity,即可实现 50% KV cache 缩减,对设备端推理部署有直接价值。

Open Code Review 是阿里巴巴开源的 AI 驱动代码审查 CLI 工具,已在内部服务数万开发者,识别数百万代码缺陷。核心设计是确定性工程与 Agent 混合驱动。

Elixir v1.20 完成第一个类型系统里程碑:无需类型注解即可对每个 Elixir 程序进行渐进类型检查,发现已验证错误与死代码,误报率极低。

Gaussian Point Splatting(SIGGRAPH 2026)提出随机点采样和64位原子操作,绕过了传统3DGS的排序瓶颈,在消费级GPU上实时渲染4.25亿个高斯函数。

QBE(Quick Backend Engine)是一个轻量级的编译器后端,定位介于 LLVM 的复杂和手写代码生成之间的中间地带。近日发布的 1.3 版本是其自 1.0 以来最重要的版本,新增约 7k 行代码,删除 1.5k 行。

一个开源工具 nbd-vram,让你在 Linux 上把 NVIDIA GPU 的显存用作交换空间。

VideoLAN 社区宣布 dav2d——AV2 编解码器的快速开源解码器。由 dav1d 团队打造,从发布到官标仅数周,解码速度有望超越 dav1d 的表现。