
我们的 CLAUDE.md 大小为 548KB。每个会话 — 包括每个子代理 — 在做任何工作之前都会加载全部内容。一次测量的无头运行在实际任务开始前向缓存写入了约 150,000 个 token,而文件本身是主要贡献者。 本周我们将其减少到 34KB,且未删除任何义务。这是我希望在开始之前就能看到

您部署了一个 AI 代理。它调用工具,读取结果,再调用更多工具,给出答案。大多数时候它能正常工作。然后用户报告出了问题,您打开追踪,发现了它: charge_card 工具返回了 402,而代理只是……继续前进,并告诉客户他们的订单已发货。 这不是指“编造事实”意义上的幻觉。这是运行中的一个 结构性

我构建了一个网页应用来回答关于我自身健康数据的问题,原因令人尴尬地微小。我本来就有一种完美的方式来提问:一个 Claude Code 技能,它查询数据库并对结果进行推理。它运行良好。它也无法在 Claude iOS 上运行,而我想要真正询问“应该担心这个吗”的时刻,我通常站在凌晨 6 点的厨房里,而

我不懂如何演奏乐器,所以显然我把它做成了一个应用。事实上,我家人人都能唱歌或演奏乐器,而我是那个格格不入的人。 我知道你在想什么,“谁会在乎?有了 AI,你几乎可以构建任何东西。” 我更兴奋的是我选择用来与我的代理一起构建这个应用的技术。具体来说,我使用了构建该应用的代理会话的上下文来查找并修复其

本周,Anthropic 的系统提示发布说明成为 Hacker News 的头条新闻。该页面是 Anthropic 发布精确指令的地方,这些指令引导 Claude 在 claude.ai 及其移动应用上运行。一天内它获得了超过 550 分和 230 条评论,讨论仍在继续。 关于该页面最有趣的地方不是

如果你的AI代理拥有带有副作用的工具,有一个问题决定了它是否 可以安全上线:当模型自信地基于虚构的理由调用一个涉及资金的工具时,会发生什么。 这篇文章介绍了一种能够堵住这个漏洞的机制,以及该机制在何处失效。背景是那些在即时通讯工具中与真实客户交谈、并能执行不可逆操作的助手:确认付款、开具发票、预订时

Anthropic 签署了《欧盟人工智能法案》关于人工智能生成内容透明度的实践准则,并开始用不可见的统计水印标记 Claude 生成的文本。几天之内,同一事件在我的信息流中得到了两种截然不同的解读。 第一篇解读在 dev.to 上,作者是 @sylwia-lask 无法检测的 AI 文本的终结?Cl

前言: 一切都始于一个误解。 我在 Gemini API 文档中发现了一个名为 Omni 的新页面,介绍了一个名为 Gemini Omni Flash 的模型,描述为“原生多模态,同时处理文本、图像、音频和视频。”我第一反应很直接:如果我把自己手机里的整个视频和照片文件夹扔进去,让它理解每个素材的内

“软件工厂”这个术语如今备受关注,这并非没有道理。AI编码助手生成代码的速度比以往快得多。但仅仅编码更快,并不意味着交付更快、更安全。在许多团队中,这只会将瓶颈转移到审查、测试、部署和运维环节。 软件工厂是一种将整个软件开发生命周期组织为相互关联、可重复运行的系统的方式。可以想象一下汽车制造装配线。

简要回答:在生成之前对完整图像请求进行分类,返回一个小的JSON决策,并将分类器和图像调用附加到同一个租户账本上。有用的设计选择是成本边界,而不是特定的审核端点。 对于物流产品来说,这个账本很重要。承运商、仓库运营方和内部支持团队可能都通过同一个图像功能发送提示词,但他们的审核率和提示词大小各不相同