Reka AI 发布全模态模型 Rho-1:单一模型处理文本、图像、视频与机器人控制
Reka AI 发布 Rho-1 研究预览版,这是一个 190 亿参数的全模态模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。所有模态作为 token 在一个共享上下文窗口中运行,无需工具调用或外部模型,同一套预测相机图像的权重也驱动机器人运动。
Reka AI 发布 Rho-1 研究预览版,这是一个 190 亿参数的全模态模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。所有模态作为 token 在一个共享上下文窗口中运行,无需工具调用或外部模型,同一套预测相机图像的权重也驱动机器人运动。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式研究系统,把模型、科研工具、文献与湿实验连接进闭环。在与 Broad Institute(哈佛与 MIT)合作的胰腺导管腺癌研究中,Quine 用一个周末完成数千化合物的预测与排序,最高排名化合物在多个湿实验中产生了最大的靶向细胞状态转变。
推荐理由:原文展示了多模态生物世界模型如何与湿实验形成闭环,读者可据此判断 AI 在药物筛选与实验设计中的实际作用边界。
Google Research 发布面向连贯长视频生成的研究框架套件,将长视频生成建模为全局优化与世界状态追踪问题,在多镜头叙事一致性与角色持久性上取得显著提升。
推荐理由:原文把长视频生成拆解为全局优化与世界状态追踪四个框架,并给出各基准上的量化提升,可据此对照现有 Agent 编排管线的短板。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能说的动态虚拟形象。该功能今天起在 Gemini Enterprise 可用,支持后台异步工具调用、97 种语言间的无缝语音同步切换,以及基于参考图像定制品牌虚拟形象,所有音视频输出均带 SynthID 水印。
推荐理由:原文列出了实时视觉形象、后台异步工具调用与 97 种语言同步能力,读者可据此评估企业级虚拟客服的落地方式。
微软研究院联合华盛顿大学与 Providence 发布开源病理基础模型 GigaPath-Flash 与 GigaTIME-Flash,权重与代码以 Apache 2.0 许可在 HuggingFace 开放。