Reflection 发布开源模型 Beam,501B 参数仅激活 23B 即可比肩 GLM 5.2
Reflection 发布首个免费模型 Beam,面向编码、逻辑推理与智能体任务,MoE 架构总参数 501B、每 token 激活 23B。据 Reflection,Beam 在高难度推理任务上以少三到四倍的算力匹配 GLM 5.2,其强化学习阶段使用了 10,500 块 Nvidia GB300 GPU、运行超过四周。
Reflection 发布首个免费模型 Beam,面向编码、逻辑推理与智能体任务,MoE 架构总参数 501B、每 token 激活 23B。据 Reflection,Beam 在高难度推理任务上以少三到四倍的算力匹配 GLM 5.2,其强化学习阶段使用了 10,500 块 Nvidia GB300 GPU、运行超过四周。
据 The Information 报道,Meta 与微软已要求员工减少使用 Anthropic 旗下 Claude 以削减成本,更多转向自研 AI 工具。微软曾预计内部使用 Anthropic AI 的年支出至少达 10 亿美元,目前相关预算已削减超三分之一,但该调整仅限内部使用,其云平台仍继续向客户提供 Claude。
Reflection 发布 Beam,一个总参数 501B、激活 23B 的纯文本 MoE 模型,面向编码、智能体与科学计算,完整权重预计本月以 Apache 2.0 开源。
Reflection AI 于当地时间周一发布首款开放权重大模型 Beam,总参数量 5010 亿,采用稀疏激活架构,每项任务仅激活 230 亿参数,主攻代码与智能体任务。
Reflection AI 正式发布首个开源权重前沿模型 Beam,定位为面向企业、公共部门和开发者的主力模型。Beam 为纯文本 MoE 模型,总参数 501B、激活参数 23B,在 23.8T tokens 上预训练,上下文窗口 100 万 token。
OpenAI 正在为 ChatGPT 和 Codex 推出不可见的机器可读文本水印,首先仅面向欧盟各套餐用户,全球 API 客户端今天起可选择开启。OpenAI 称其 textGrain 水印在基准测试中与 Google DeepMind 的 SynthID 等方案持平或更优,但同时强调它不保证可靠检测,也无法证明文本作者归属。
AWS 官方博客介绍如何在 AWS GovCloud (US) 中通过 Amazon Bedrock 运行 Claude Code,让受 ITAR 等合规要求约束的工作负载也能进行 AI 辅助开发。
HackerRank 将 AI 面试官 Chakra 结束约六个月测试后正式向客户开放,测试期间已进行超过 50 万场面试,Snowflake、Snorkel 和 Capgemini 等公司参与试用。
OpenAI 宣布为配合《欧盟人工智能法案》的内容透明要求,未来几周将在欧盟地区符合条件的 ChatGPT 和 Codex 文本输出中加入机器可识别的隐形水印,技术名为 textGrain(文本粒水印)。
DeepSeek Harness 组成员崔添翼回应称,v0.2.1-alpha.1 中加入的 Claude Code Mods 兼容层目前仅为 alpha 实验性功能,主要用来验证 Claude Code Mods 向插件作者提供的扩展能力是否大致是 DSH「一切皆插件」架构所提供能力的一个子集,目前还无法让所有 Claude Code Mods 无缝运行。
AI 正在改变开发者工作,GitHub 提出三项需要强化的技能:指挥 AI 智能体、不盲信 AI 的首个答案、用 AI 解决更大的问题。例如让第二个 AI 模型审查第一个模型的输出:GitHub Copilot 内置的 Rubber Duck 智能体即用第二模型在推进前评审方案、代码与测试。当 AI 承担更多实现,清晰定义问题、评估权衡与做出技术决策等人类判断力反而更关键。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍公司向 AI-native 转型的由内而外策略:先用 AI 提速内部产品开发,再把同样能力用于客户体验。
Latent Space 专访 MIT 博士生 Alex Zhang,讨论递归语言模型(RLM)、AI 生成 GPU kernel 与 harness 设计。RLM 以代码为唯一工具、把上下文卸载到代码环境中的内存,训练短任务可直接泛化到 8–30 倍长度的任务以及完全不同的任务类型。
GPT-6 Astra Ultrafast 现已通过 OpenAI API 提供,运行在 NVIDIA Blackwell GPU 上,并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出了 Astra Ultrafast 相对 Standard 模式最高 8 倍的 token 生成速度对比,读者可据此判断其对编码智能体工作流的影响。
Simon Willison 用 Claude Opus 5.5 改进纯 Python WebAssembly 引擎 pwasm,42 次提交后几乎支持全部 WASM 规范。
Latent Space 在 OpenAI DevDay 后专访 Computer Use 负责人 Ari Weinstein 与 API 负责人 Nikunj Handa,逐项拆解当天发布的新 Agent 栈。
Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。
推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 油藏模拟器代码迁移到 C++,该代码库没有测试套件和集中文档。团队先给 Fortran 代码加状态导出并用 C++ 测试框架做数值一致性验证,再用 Vibe CLI 生成上百个智能体沿调用树整理散落在 PDF 和注释中的文档。