全部 AI技术 安全技术 IT技术
IT技术

提示缓存实践:命中率从7%提升至74%(生产推理系列)

提示缓存机制,以及在DigitalOcean Serverless上的第一手测量(Anthropic风格的显式 cache_control )。这些机制适用于所有提供商;DigitalOcean的数据来自有记录的基准测试,而非营销宣传。 提示缓存是大多数生产环境LLM团队已配置但并未真正受益的杠杆率

2026/8/5 210
IT技术

生产环境中运行Qwen 3:推理供应商对比

选择 Qwen 模型只是第一个生产决策。接下来的问题是在哪里运行以及如何运行它。 对于实验性 聊天机器人 的最佳提供商,可能并不适合受监管的企业应用、对延迟敏感的编码助手或每天处理数百万个令牌的智能体。生产团队不仅要考虑广告宣传的每百万令牌成本,还必须评估首令牌时间、输出速度、并发限制、上下文窗口长

2026/8/5 200
IT技术

产品实验中的工具变量:在Python中消除LLM路由决策的混杂

对于负责管理多模型网关的数据科学领导者和产品经理来说,衡量模型质量的标准回归方法存在根本性缺陷。 无论你是否承认,你其实都在进行一项因果推断实验,而你的路由规则正在悄无声息地污染你的性能估计。 考虑这样一个网关:它根据置信度阈值将传入的查询路由到高级模型或更快、更便宜的替代模型。置信度得分低于某个阈

2026/8/4 242
IT技术

为什么尖峰推理流量会破坏专用GPU算力模型

引言 专用GPU处理突发的LLM推理流量,在胜过按令牌计费之前,需要先达到一个明确、可计算的吞吐量下限——持续每秒1,910个可计费令牌;该下限的推导及其等效利用率百分比将在本文后面展开。本文将这一下限应用于DigitalOcean上的 llama3.3-70b-instruct ,详细分析了三种具

2026/8/4 266
IT技术

提示缓存如何工作,何时才能真正降低LLM成本?

提示缓存被宣传为一种免费获得的折扣。它并非自动开启,也并非在每个提供商那里都免费。节省的费用取决于你的流量的三个方面:每个请求中有多少内容重复,有多少请求共享该重复部分,以及它们之间经过多少时间。如果这三方面都做对了,在长时间的智能体会话中,缓存可以将输入令牌成本降低80%到90%。如果做错了,至少

2026/8/4 200
IT技术

如何构建自动切换模型的AI应用

大型语言模型(LLM)从根本上改变了我们构建现代软件的方式。 但是,对每个用户请求都依赖单一AI模型会带来严重的生产风险。API中断时有发生。对于简单任务,专有模型可能成本高昂。而较便宜的开源模型可能难以处理复杂的逻辑推理。 当我和我的团队为客户支持平台构建企业级AI引擎时,我们所有事情都依赖一个顶

2026/8/3 267
IT技术

提示工程与循环工程:开发者指南

对许多开发者来说,AI工作流程大致是这样的:编写提示词,获取响应,复制有用的部分,然后继续下一项任务。 这种方式涵盖了令人意想不到的广泛任务,从总结文档到起草电子邮件,再到解释一段代码。 但当任务涉及多个步骤、外部数据或依赖于模型刚返回结果而做出的决策时,这种工作流程就开始失效了。你最终不得不手动重

2026/8/3 196
IT技术

长上下文LLM服务中的真实权衡:内存、延迟、成本与准确性

“长上下文”的含义,以及为什么“支持”不等于“实际服务” 上下文是你在一次请求中发送给模型的所有内容:提示词、文档、代码、对话历史。它使用令牌(token)来衡量,令牌是词元片段,大约每1,000个令牌对应750个单词。128K令牌窗口(大约相当于一部小说的文本量)是当前常见的标准。 Llama 3

2026/8/3 163
IT技术

你的AI代理需要有限状态机(FSMs)

你的AI智能体需要有限状态机(FSM) 在我之前的文章中,我论证了AI如何改变约束在软件开发中的角色。 多年来,许多开发者将约束视为需要最小化的东西。动态语言比静态语言更受欢迎。无模式数据库承诺更大的灵活性。约定取代了配置。隐式行为往往比显式定义更受青睐。 这种动机是容易理解的。约束感觉像是摩擦,拖

2026/7/29 244
IT技术

我构建了一个实时重写自身UI的聊天应用

原文:https://dev.to/varshithvhegde/i-built-a-chat-app-that-rewrites-its-own-ui-in-real-time-21m5 我之前一直有个想法挥之不去 所有的AI聊天应用都一个样。你输入内容,模型返回文本或Markdown,UI将其

2026/7/29 238