用 Amazon Bedrock AgentCore 评估多智能体系统的可解释性与有用性
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解离线指标与线上实验的对应关系。
微软研究院推出 MindTopo,一个评估多模态大语言模型拓扑推理能力的基准,覆盖连通性、分离、顺序、包围和绳结五类拓扑关系,并区分静态推理与交互规划两个认知层级。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。