Reflection 发布首个开源权重模型 Beam,主打低算力
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,可通过全托管 API 调用,支持跨区域推理、提示词缓存和服务层级。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与安全测试智能体的完整调用示例,可据此评估托管开源模型的落地方式。
Reflection AI 发布首个前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token。公司称本月将公开模型权重和完整技术细节,并通过超大规模云厂商和 neocloud 分发。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解离线指标与线上实验的对应关系。
GitHub 提出 AI 时代开发者应强化三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以添加认证流程为例,展示开发者从自己写代码转向定义任务、审查多个智能体输出并做技术决策。GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型对计划、代码和测试进行批判性审查。
Airbnb CTO Ahmad Al-Dahle 介绍了公司转向 AI 原生公司的做法:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
Chatham Financial 借助 OpenAI 的 Codex 和 GPT-5.6 构建技术并重构工作流程,将交易验证时间从 30 分钟缩短到 4 分钟以内。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专业知识,后者是智能体连接工具和数据的标准,二者可组合使用;RAG 并未消亡,检索能让模型基于训练数据外的文档、内部知识和代码库上下文作答,减少 token 浪费和不完整回答。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量落地,而非一次性切换。
推荐理由:作者以亲历者身份复盘用 AI 智能体把 Copilot 运行时从 TypeScript 迁到 Rust 的完整过程,给出可迁移的多智能体协作与缓存策略。