全部 AI技术 安全技术 IT技术
AI技术

将 CLAUDE.md 从 548KB 压至 34KB:测量加载时机及保持小巧的提交门禁

我们的 CLAUDE.md 大小为 548KB。每个会话 — 包括每个子代理 — 在做任何工作之前都会加载全部内容。一次测量的无头运行在实际任务开始前向缓存写入了约 150,000 个 token,而文件本身是主要贡献者。 本周我们将其减少到 34KB,且未删除任何义务。这是我希望在开始之前就能看到

2026/8/18 162
AI技术

代理忽略了失败的工具调用:在 CI 中捕获的方法

您部署了一个 AI 代理。它调用工具,读取结果,再调用更多工具,给出答案。大多数时候它能正常工作。然后用户报告出了问题,您打开追踪,发现了它: charge_card 工具返回了 402,而代理只是……继续前进,并告诉客户他们的订单已发货。 这不是指“编造事实”意义上的幻觉。这是运行中的一个 结构性

2026/8/18 146
AI技术

不要给模型SQL

我构建了一个网页应用来回答关于我自身健康数据的问题,原因令人尴尬地微小。我本来就有一种完美的方式来提问:一个 Claude Code 技能,它查询数据库并对结果进行推理。它运行良好。它也无法在 Claude iOS 上运行,而我想要真正询问“应该担心这个吗”的时刻,我通常站在凌晨 6 点的厨房里,而

2026/8/18 143
AI技术

如何利用智能体上下文提高Playwright测试覆盖率

我不懂如何演奏乐器,所以显然我把它做成了一个应用。事实上,我家人人都能唱歌或演奏乐器,而我是那个格格不入的人。 我知道你在想什么,“谁会在乎?有了 AI,你几乎可以构建任何东西。” 我更兴奋的是我选择用来与我的代理一起构建这个应用的技术。具体来说,我使用了构建该应用的代理会话的上下文来查找并修复其

2026/8/18 160
IT技术

如何用AI现代化遗留应用而避免变成重写

我曾见过一些遗留系统迁移被认为很成功,仅仅因为旧框架从代码仓库中消失了。 六个月后,团队仍在处理同样的耦合问题、同样不清晰的业务规则,以及几乎相同的部署问题。 技术虽然变了,但整个系统并没有发生太大变化。 AI 让这个问题变得更加有趣。 它可以比人工团队更快地完成代码翻译。它可以解释陌生的类、生成测

2026/8/18 162
IT技术

连续批处理可改善P50,但可能毁掉P99:实测权衡

连续批处理是现代LLM服务系统的核心特性。它被包含在每个主要引擎中,经常出现在对比图表中,其对吞吐量的影响已经得到充分证实: Anyscale 广受引用的基准测试报告称,与基础服务设置相比,吞吐量提升高达23倍,而Orca论文在早期系统上测量到高达36.9倍提升。这些结果是真实的,它们主要描述吞吐量

2026/8/18 159
IT技术

如何用vLLM扩展AI智能体的LLM推理

在本教程中,我将向你展示如何使用 vLLM 为 AI 代理扩展 LLM 推理。我将帮助你建立对 LLM 推理工作原理的直觉,探讨为什么代理工作负载会造成 GPU 调度和内存压力,并研究 vLLM 如何设计来提高吞吐量。 然后,我们将运行一个本地 vLLM 服务器,并通过一个 AI 代理使用其兼容 O

2026/8/18 174
IT技术

如何管理代码库中的上下文文件,以从AI编码代理获得更好的输出

你让编码代理新建一个端点,九十秒后你就有了一个能工作的端点。 然后你查看 diff,发现它引入了一个不在你的 package.json 中的验证库,它用 Jest 编写测试,尽管你的团队去年春天已经迁移到了 Node 测试运行器,而且它从路由处理器内部访问了数据库,因为它无法知道代码库中的每个其他处

2026/8/18 128
AI技术

Claude的系统提示词从358词增至3235词:对生产AI团队的启示

本周,Anthropic 的系统提示发布说明成为 Hacker News 的头条新闻。该页面是 Anthropic 发布精确指令的地方,这些指令引导 Claude 在 claude.ai 及其移动应用上运行。一天内它获得了超过 550 分和 230 条评论,讨论仍在继续。 关于该页面最有趣的地方不是

2026/8/17 181
IT技术

RAG在生产环境中的实际运行成本:完整成本分解

几乎每个规划RAG项目的团队都会在错误的项目上担心成本。人们的直觉是,嵌入10万份文档必定昂贵,存储几十万向量需要专门的基础设施,而摄取管道才是预算的大头。这三个假设全都是错的,下面的数学计算会显示差距有多大。 以下是在DigitalOcean上,一个基于10万份文档语料库的生产级RAG系统,按项目

2026/8/17 182