Strata 引擎开源,12GB 显存可跑 125B Qwen3.8,单张 RTX 5070 达 94 词元/秒
开发者 Niko1221 开源 Strata 引擎,可在 12GB 显存以上的消费级显卡上运行量化版 Qwen3.8-Flash-Next(1250 亿参数)模型。
推荐理由:原文给出把 MoE 专家分级载入 RAM 加投机解码的显存优化思路,可迁移到其他大模型本地部署场景。
技术方向
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
4 条精选近 30 天 4 条共收录 15 条
开发者 Niko1221 开源 Strata 引擎,可在 12GB 显存以上的消费级显卡上运行量化版 Qwen3.8-Flash-Next(1250 亿参数)模型。
推荐理由:原文给出把 MoE 专家分级载入 RAM 加投机解码的显存优化思路,可迁移到其他大模型本地部署场景。
OpenAI 发布 GPT-6 系列模型实践指南,说明创业公司如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:指南覆盖模型选型、推理强度调节与生产工作流准备,可直接用于 GPT-6 多版本之间的选型与调参决策。
GPT-6 Astra Ultrafast 现已通过 OpenAI API 提供,运行在 NVIDIA Blackwell GPU 上,并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出了 Astra Ultrafast 相对 Standard 模式最高 8 倍的 token 生成速度对比,读者可据此判断其对编码智能体工作流的影响。
Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。
推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。