跳到正文
今天10月6日周二10 条
  1. The Decoder62

    Cohere 发布 North 2,打造兼容任意模型的企业 AI 智能体控制中心

    Cohere 发布 North 2,将其企业平台升级为可跨会话保持上下文、自主执行多步工作流的 AI 智能体控制中心。平台模型无关,既支持 Command A+ 也可接入企业自有模型,并支持本地、云端及完全物理隔离部署,管理员可通过 North Admin 管理 token 用量、用户配额与访问权限,智能体执行关键操作前需请求人工批准。

  2. TechCrunch · AI64

    TikTok 上线 AI 购物助手与一键结账功能

    TikTok 宣布上线 AI 购物助手和一键结账功能,用户可在 For You 信息流中一键直接向品牌购买商品。购物助手为对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存等实时指导并协助完成购买;新功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务与支付平台合作构建。

10月5日周一
  1. MIT Technology Review · AI19

    将预测性分析带入智能体 AI 时代

    2026 年企业 AI 的焦点已从“预测模型能否超越统计预测”转向“如何让预测系统自主依据结论行动而不偏离业务意图”。深度学习与生成式 AI 驱动的智能分析支持实时训练、不再依赖季度刷新,并将数据来源扩展至非结构化的交互记录,推动企业从被动复盘走向前瞻决策。Everest Group 合伙人 Vishal Gupta 判断,“分析”一词正在被 AI 取代。

10月4日周日
  1. IT之家68

    DeepSeek Harness 组成员崔添翼回应兼容 Claude Code Mods:核心理念是一切皆插件,可扩展性是初心

    DeepSeek Harness 组成员崔添翼回应称,v0.2.1-alpha.1 中加入的 Claude Code Mods 兼容层目前仅为 alpha 实验性功能,主要用来验证 Claude Code Mods 向插件作者提供的扩展能力是否大致是 DSH「一切皆插件」架构所提供能力的一个子集,目前还无法让所有 Claude Code Mods 无缝运行。

10月3日周六
  1. OpenAI News60

    GPT-6 系列模型实践指南

    OpenAI 发布 GPT-6 系列模型实践指南,说明创业公司如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:指南覆盖模型选型、推理强度调节与生产工作流准备,可直接用于 GPT-6 多版本之间的选型与调参决策。

10月2日周五
  1. GitHub Blog · AI & ML37

    AI 正在改变开发者工作:三项需要强化的技能

    AI 正在改变开发者工作,GitHub 提出三项需要强化的技能:指挥 AI 智能体、不盲信 AI 的首个答案、用 AI 解决更大的问题。例如让第二个 AI 模型审查第一个模型的输出:GitHub Copilot 内置的 Rubber Duck 智能体即用第二模型在推进前评审方案、代码与测试。当 AI 承担更多实现,清晰定义问题、评估权衡与做出技术决策等人类判断力反而更关键。

  2. Latent Space55

    MIT Alex Zhang 谈 RLM 与智能体框架设计

    Latent Space 专访 MIT 博士生 Alex Zhang,讨论递归语言模型(RLM)、AI 生成 GPU kernel 与 harness 设计。RLM 以代码为唯一工具、把上下文卸载到代码环境中的内存,训练短任务可直接泛化到 8–30 倍长度的任务以及完全不同的任务类型。

10月1日周四
  1. Google DeepMind78

    Gemini 4 Argon 发布:下一代前沿智能

    Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。

    推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。

9月30日周三
9月29日周二
  1. Microsoft Research72

    Microsoft Research 推出 Quine:面向生物学复杂性的 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式研究系统,把模型、科研工具、文献与湿实验连接进闭环。在与 Broad Institute(哈佛与 MIT)合作的胰腺导管腺癌研究中,Quine 用一个周末完成数千化合物的预测与排序,最高排名化合物在多个湿实验中产生了最大的靶向细胞状态转变。

    推荐理由:原文展示了多模态生物世界模型如何与湿实验形成闭环,读者可据此判断 AI 在药物筛选与实验设计中的实际作用边界。

9月28日周一
  1. Hugging Face Blog68

    Holo4 发布:通用计算机操作智能体系列,含 27B dense 与 35B-A3B MoE 两款

    Hcompany 发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两种尺寸,可通过 GUI、代码、MCP 和 API 与软件交互,同一模型可跨桌面、网页、Android、代码沙箱与业务 API 运行。

    推荐理由:原文给出了多接口能力说明与 OSWorld 2.0 成本性能对比,读者可据此判断开源智能体模型相对闭源前沿模型的取舍。

9月26日周六
  1. GitHub Blog · AI & ML44

    GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 是用户与 agent 双向共享的可定制界面,可做成看板、问题分流板或清单等形态。在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,agent 即会生成界面并在右侧面板打开,无需手写代码。创建后可持续调整,也能作为扩展保存给团队共享,或从 Awesome Copilot 安装现成模板再定制。

9月25日周五
  1. Google Research64

    Google Research 发布连贯长视频生成研究框架套件 Co-Director、CANVAS、A²RD 与 VQQA

    Google Research 发布面向连贯长视频生成的研究框架套件,将长视频生成建模为全局优化与世界状态追踪问题,在多镜头叙事一致性与角色持久性上取得显著提升。

    推荐理由:原文把长视频生成拆解为全局优化与世界状态追踪四个框架,并给出各基准上的量化提升,可据此对照现有 Agent 编排管线的短板。

  2. Google DeepMind64

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar 实时虚拟形象功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能说的动态虚拟形象。该功能今天起在 Gemini Enterprise 可用,支持后台异步工具调用、97 种语言间的无缝语音同步切换,以及基于参考图像定制品牌虚拟形象,所有音视频输出均带 SynthID 水印。

    推荐理由:原文列出了实时视觉形象、后台异步工具调用与 97 种语言同步能力,读者可据此评估企业级虚拟客服的落地方式。

9月9日周三
9月7日周一
8月24日周一
  1. Import AI34

    Import AI 470:机器无权利;用 SPADE 自动化环境生成;用 Hawkeye 构建更优 GPU kernel

    多校研究者推出 SPADE 框架,让 LLM 在自博弈中交替生成可执行训练环境并尝试求解,用强模型生成的合成数据反哺模型自身训练。SPADE 在 Qwen3-30B-A3B-Instruct-2507 上经 GRPO 微调后,游戏环境套件平均分达 58.3,较 base 提升 8.1;METR 另分析称 AI 显著加速了网络安全漏洞发现,对数学研究仅有小幅加速,对 AI 研究优化尚无可测加速。