Reflection 发布 Beam:501B-A23B 美国开源模型
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现。
本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,一至三位数操作数准确率 97.04%,十至十三位数骤降至 6.44%。启用推理后 169 次配对测试中答对 167 次。该实验在 DGX Spark 上复现 GPT-4o 的单词加法测试。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解离线指标与线上实验的对应关系。
Aleph Alpha 用自建基准测试了阿里 Qwen、DeepSeek 和月之暗面 Kimi 等中国模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统仅将 17% 至 41% 的回答评为平衡,其余为重复官方立场、回避或拒答。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 Astra 的 $10/$50 大幅降低,据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,便于对照其与 Astra、Opus 5.5 的实际差距。
OpenAI 在 DevDay 2026 发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 全部发布与第三方评测数据,可一次看清定价、能力与争议点。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。
微软研究院推出 MindTopo,一个评估多模态大语言模型拓扑推理能力的基准,覆盖连通性、分离、顺序、包围和绳结五类拓扑关系,并区分静态推理与交互规划两个认知层级。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。