跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

6 条精选近 30 天 5 条共收录 23 条

更新

部署工程的精选

今天10月6日周二第 1–6 条
10月3日周六
  1. OpenAI News60

    GPT-6 系列模型实践指南

    OpenAI 发布 GPT-6 系列模型实践指南,说明创业公司如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:指南覆盖模型选型、推理强度调节与生产工作流准备,可直接用于 GPT-6 多版本之间的选型与调参决策。

10月2日周五
  1. Google Research68

    Google 发布基于 TEE 的新一代联邦学习系统,迈向可证明隐私的学习

    Google Research 宣布新一代联邦学习系统,利用可信执行环境(TEE)提供完全可验证、可审计的数据匿名化保证,Gboard 已率先采用。新系统由客户端加密上传与访问策略、基于 RAFT 共识的 KMS 密钥管理、用 Federated Language 编排的 TEE 训练循环以及加密恢复状态协同工作,训练时间从此前的 1-2 个月大幅缩短,同时模型准确率提升。

    推荐理由:原文对比了新旧联邦学习系统在隐私可验证性与训练效率上的差异,读者可了解 TEE 如何移除对服务器运营方的信任依赖。

9月24日周四
  1. Google DeepMind63

    Google DeepMind 为 Private AI Compute 引入安全的服务端持久记忆

    Google DeepMind 宣布为 Private AI Compute 平台引入私密的服务端记忆层,让 AI 在跨设备间保持长期连续性的同时维持与端侧处理同级的隐私标准。

    推荐理由:原文给出安全飞地、加密通道与设备端密钥相结合的架构细节,可迁移到其他需要云上持久记忆的隐私保护设计中。

8月20日周四
  1. Mistral AI71

    Mistral AI 发布 Agentic Search:为 AI 系统提供更准确高效的检索结果

    Mistral AI 发布 Agentic Search 检索层,以多步检索循环让模型在复杂文档中查找、检视并验证信息,在 FinanceBench 上将正确率从 26.7% 提升至 86%,在 OfficeQA Pro 上从 6.3% 升至 51.9%,p90 延迟最高降低 39.6%,token 消耗最多减少三分之一。

    推荐理由:原文用两组基准给出 Agentic Search 相对一次式 RAG 的准确率、token 与延迟对比,可据此判断多步检索循环的收益边界。