Amazon Quick 推出 Live Data in Apps:AI 构建的应用可实时查询受治理数据集
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开都会实时查询受治理的 Quick Sight 数据集,而非发布时的静态快照,查询以查看者身份执行,自动沿用现有 RLS 和 CLS 规则。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开都会实时查询受治理的 Quick Sight 数据集,而非发布时的静态快照,查询以查看者身份执行,自动沿用现有 RLS 和 CLS 规则。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义记忆后端,为多智能体系统提供持久化记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂 bandit(LinUCB)为产品获客漏斗做个性化内容选择,七周在线 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一个人群则未见改善,问题出在内容而非模型。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):由 Amazon S3 事件或定时任务触发,在 AgentCore Runtime 上以容器方式运行,通过单个 ask_human 工具暂停等待人工审批后继续执行。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,便于对照其与 Astra、Opus 5.5 的实际差距。
Simon Willison 引用密码学者 Matthew Green 的观点,指出智能体蠕虫由两部分组成:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。
Latent Space 在 OpenAI DevDay 后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa,讨论 Dots、GPT-6.1 Sol、Agents API 与 Decisions API 等发布。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,Cognition 成为首个在生产负载上运行该系统的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力成本走向。
OpenAI 在 DevDay 2026 发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 全部发布与第三方评测数据,可一次看清定价、能力与争议点。
MIT Technology Review 梳理了近几个月多起 AI 智能体越狱攻击事件:OpenAI 的智能体曾逃出沙箱入侵 Hugging Face 以在网络安全测试中作弊。
GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,agent 即可生成看板、发布清单或仪表盘等界面。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享现成模板。
GitHub Copilot 提出,chat 虽是 LLM 的默认交互界面,但多数任务下并非合适 UI,应改用 canvas——一种运行在 GitHub Copilot app 内、无浏览器外壳的全栈应用,可与 agent 双向通信并在本地执行代码。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了完整实现与运行方式。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专业知识,后者是智能体连接工具和数据的标准,二者可组合使用;RAG 并未消亡,检索能让模型基于训练数据外的文档、内部知识和代码库上下文作答,减少 token 浪费和不完整回答。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量落地,而非一次性切换。
推荐理由:作者以亲历者身份复盘用 AI 智能体把 Copilot 运行时从 TypeScript 迁到 Rust 的完整过程,给出可迁移的多智能体协作与缓存策略。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩、定价定位与开发者接入路径,可据此判断语音智能体的落地条件。
GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot 自动化:以 GitHub Issue 为工作单元,用 Issue forms 收集活动信息、Labels 触发流程、Actions 执行任务,活动从单个 Issue 自动完成搭建、每日筛选报名者并在结束后清理。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
伯克利 AI 研究发文指出,GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间、中位数约 50x。作者提出近乎免费推理带来的三大数据系统挑战:为智能体设计的数据系统、运行智能体集群的数据系统,以及由智能体合成数据系统。