Qwen3.8 27B 用英文单词做加法的基准测试
本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,一至三位数操作数准确率 97.04%,十至十三位数骤降至 6.44%。启用推理后 169 次配对测试中答对 167 次。该实验在 DGX Spark 上复现 GPT-4o 的单词加法测试。
本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,一至三位数操作数准确率 97.04%,十至十三位数骤降至 6.44%。启用推理后 169 次配对测试中答对 167 次。该实验在 DGX Spark 上复现 GPT-4o 的单词加法测试。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI 系统 Ataraxos,在 Stratego 中以 15 胜 1 负 4 平击败被认为是史上最强的选手 Pim Niemeijer。
微软研究院推出 MindTopo,一个评估多模态大语言模型拓扑推理能力的基准,覆盖连通性、分离、顺序、包围和绳结五类拓扑关系,并区分静态推理与交互规划两个认知层级。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。
Berkeley AI Research 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型脆弱的"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 合作完成。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模 LLM 中识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。