全部 AI技术 安全技术 IT技术
IT技术

如何用Claude和MCP构建隐私优先的医学图像去标识化智能体

想象一下,让一个AI助手对数千张医学图像进行去标识化处理。它运行整个流程、跟踪进度、总结每一个决策,并告诉你哪些文件需要人工审核,而整个过程从未看过任何一像素的患者数据。 乍一听这似乎不可能。AI助手通常需要访问它们帮你处理的数据。 在本教程中,你将构建一个不查看敏感医学图像的AI代理。相反,它通过

2026/8/7 245
IT技术

连续批处理机制:vLLM、TGI和SGLang背后的调度器

引言 服务大型语言模型本质上是一个伪装成硬件问题的调度问题。现代GPU是一台吞吐量机器。它希望一次执行数千次算术运算。但服务接收到的请求通常一次一个地到达,时机不可预测,提示和响应的长度差异很大。推理调度器的工作是管理一台擅长批量工作的机器,而负载却是零散而不规则地流入。 本文首先解释单个请求如何在

2026/8/6 205
IT技术

实时客户支持代理与后备路由

引言 客户支持是 AI代理 最强大的应用场景之一。它涉及重复性问题、时间压力、信息查找以及对准确答案的需求。每天有数百万家企业收到相同类型的问题和请求。我的订单在哪里?我想要退款。无法访问我的账户。这个功能如何工作?这与……兼容吗?这要多少钱?我对这个产品不满意。 理论上,一个经过适当训练的 AI客

2026/8/6 229
IT技术

无服务器 vs. 专用 vs. 自托管 LLM 推理:自托管何时真正更便宜

每位创始人都听过同样的建议:先租用 API 起步,等想省钱时再自托管自己的 GPU。这个建议被反复提及,几乎成了民间传说。所以我们没有盲目听信,而是在 DigitalOcean 上进行了实测。相同的模型、相同的提示词、三个真实的产品形态( DigitalOcean 无服务器推理 、 DigitalO

2026/8/6 166
IT技术

预填充/解码分离:生产级LLM推理为何拆分至独立硬件

超越预填充税:在独立的GPU池上运行预填充和解码意味着什么,谁在生产环境中这样做,以及何时值得这种复杂性。 想象一个周六晚上8点的餐厅厨房。一位厨师正在为十二道菜的品尝菜单切菜,已经切了二十分钟,而三十桌在一个小时前下单的顾客,每次厨师转身回到砧板时,都看着他们吃到一半的盘子变凉。没有真正的厨房会这

2026/8/5 221
IT技术

提示缓存实践:命中率从7%提升至74%(生产推理系列)

提示缓存机制,以及在DigitalOcean Serverless上的第一手测量(Anthropic风格的显式 cache_control )。这些机制适用于所有提供商;DigitalOcean的数据来自有记录的基准测试,而非营销宣传。 提示缓存是大多数生产环境LLM团队已配置但并未真正受益的杠杆率

2026/8/5 211
IT技术

生产环境中运行Qwen 3:推理供应商对比

选择 Qwen 模型只是第一个生产决策。接下来的问题是在哪里运行以及如何运行它。 对于实验性 聊天机器人 的最佳提供商,可能并不适合受监管的企业应用、对延迟敏感的编码助手或每天处理数百万个令牌的智能体。生产团队不仅要考虑广告宣传的每百万令牌成本,还必须评估首令牌时间、输出速度、并发限制、上下文窗口长

2026/8/5 201
IT技术

产品实验中的工具变量:在Python中消除LLM路由决策的混杂

对于负责管理多模型网关的数据科学领导者和产品经理来说,衡量模型质量的标准回归方法存在根本性缺陷。 无论你是否承认,你其实都在进行一项因果推断实验,而你的路由规则正在悄无声息地污染你的性能估计。 考虑这样一个网关:它根据置信度阈值将传入的查询路由到高级模型或更快、更便宜的替代模型。置信度得分低于某个阈

2026/8/4 242
IT技术

为什么尖峰推理流量会破坏专用GPU算力模型

引言 专用GPU处理突发的LLM推理流量,在胜过按令牌计费之前,需要先达到一个明确、可计算的吞吐量下限——持续每秒1,910个可计费令牌;该下限的推导及其等效利用率百分比将在本文后面展开。本文将这一下限应用于DigitalOcean上的 llama3.3-70b-instruct ,详细分析了三种具

2026/8/4 267
IT技术

提示缓存如何工作,何时才能真正降低LLM成本?

提示缓存被宣传为一种免费获得的折扣。它并非自动开启,也并非在每个提供商那里都免费。节省的费用取决于你的流量的三个方面:每个请求中有多少内容重复,有多少请求共享该重复部分,以及它们之间经过多少时间。如果这三方面都做对了,在长时间的智能体会话中,缓存可以将输入令牌成本降低80%到90%。如果做错了,至少

2026/8/4 201