向来注重隐私的 Apple,为什么敢把一部分 AI 云端推理放在 Google Cloud 上跑?
本周 WWDC 期间,Google Cloud 分享的一篇博客和 Apple 安全博客揭示了答案:苹果AI扩展到谷歌云,背后依赖的不是普通云端推理,而是一套围绕 Confidential AI 构建的可信推理基础设施。
它要解决的不只是模型在哪里运行、GPU 性能如何、推理延迟多少,而是当用户数据进入云端推理时,能不能确保它只运行在可信环境里。我们通过硬件可信证明、可信启动链路、系统镜像验证,以及基于策略的密钥释放机制,让云端推理环境在处理用户数据之前,先证明自己运行在预期硬件上,CPU/GPU 环境可信,系统镜像和软件栈没有被替换,密钥也只会释放给通过验证的推理任务。只有这些条件被满足,敏感数据才会进入后续推理流程。
这背后的核心变化是:过去很多安全问题,往往依赖合同、合规流程和平台承诺来约束;但在 private inference 里,信任正在从制度承诺下沉到系统架构本身。
这次产品的合作代表了AI 基础设施正在进入一个新阶段:机密计算正在从过去偏金融、政务等领域的相对小众应用,走向数以亿计用户会间接使用的 C 端消费级 AI 基础设施。通过可信环境保护云端推理节点,不再只是少数 ...
Dynamic Idle Resource Leasing Notes
动态闲置资源租赁系统论文Note论文标题:Dynamic Idle Resource Leasing To Safely Oversubscribe Capacity At Meta会议:ACM SoCC 2024(11月)
背景Meta 自家私有云集群,为了应对负载峰值、故障恢复和未来增长,会大量预留资源。这些预留资源大多数时间都是闲置的,造成了浪费(成本 + 碳排)。
那能不能“安全地”利用这些dark capacity?比如给不重要的任务临时用一下?但关键是要保证不能影响到正式服务的 SLO(Service-Level Objectives)。
论文核心贡献1. 被动缓冲区(Passive Buffers)回收机制把资源分两类:
主动 buffer:活跃服务器中的空余 headroom
被动 buffer:完全没被用的服务器(最容易被浪费)
他们把被动的这一块提取出来,放进“弹性资源池”(elastic pool)里让其他任务租用。
2. 动态资源租赁平台(Leasing Platform)
提供两类租用服务:
**High-Availability ( ...
Hello World
Hello World!
1console.log("Hi!");


