跳到正文
今天10月6日周二19 条
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,可通过全托管 API 调用,支持跨区域推理、提示词缓存和服务层级。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与安全测试智能体的完整调用示例,可据此评估托管开源模型的落地方式。

  2. TechCrunch · AI66

    Reflection 发布开源权重模型 Beam,对标中国开源模型

    Reflection AI 发布首个前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token。公司称本月将公开模型权重和完整技术细节,并通过超大规模云厂商和 neocloud 分发。

  3. TechCrunch · AI60

    TikTok 推出 AI 购物助手与一键结账

    TikTok 周一宣布推出 AI 购物助手和站内一键结账功能,用户可直接在品牌处下单。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存和完成购买等实时导购。新功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务和支付平台合作搭建,用户可在 For You 信息流中一键购买。

  4. AWS Machine Learning Blog34

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。

  5. TechCrunch · AI22

    两姐妹推出 Hot Girl Hotline:面向年轻女性的 AI 情感建议应用

    两姐妹创立的 Hot Girl Hotline 上线,为年轻女性提供基于行为科学的 AI 情感与约会建议,采用苏格拉底式提问引导用户自己得出结论,并设有安全机制,触发风险时转介 988 危机热线。该应用月订阅费 9.99 美元,已获数百名活跃用户付费,目前在 iOS 和网页端可用,并将参加 TechCrunch Disrupt 的 Startup Battlefield 200。

10月5日周一
  1. TechCrunch · AI40

    研究人员追踪到一支中国 AI「智能体舰队」

    独立研究人员发现一支 AI 智能体舰队在腾讯基础设施上运行,目标指向阿里巴巴旗下高德地图服务,查询内容为公园、动物园、医院等公共场所不同入口的路线。研究人员拒绝用「swarm」一词,称其为「agent fleet」,因为多个并行智能体执行同类任务却无相互通信迹象。该活动通过监控 URLquery 流量发现,研究仍在进行中。

  2. MIT Technology Review · AI13

    从预测到自主决策:预测分析如何迈入智能体 AI 时代

    企业 AI 的竞争前沿已从预测精度转向自主决策,核心挑战是让预测系统在自主行动时不偏离业务意图。深度学习和生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,数据来源也从结构化数值扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正让位于 AI。

10月4日周日
  1. Simon Willison34

    Simon Willison:按量付费服务需要默认硬性预算上限,AWS 已推出支出限额

    Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到每月 $X 额度后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出了 Spend Caps。

  2. The Verge · AI42

    Capcom 计划打造“与 AI 共同创作游戏”的未来

    Capcom 在 Capcom Open Conference RE: 2026 上提出将 AI 技术整合进开发流程,计划逐步把 RE Engine 改造成“AI 生成游戏引擎”,迈向“与 AI 共同创作游戏”的未来。程序员 Satoshi Ishida 称,此举旨在解决《生化危机》级别游戏的开发耗时问题;Capcom 此前表示不会在游戏中使用 AI 生成素材,而是用 AI 提升开发效率。

10月3日周六
  1. TechCrunch · AI42

    盘点能住进你短信里的 AI 智能体:Caddy、Fambot、Folk、Instinct 等

    一批 AI 智能体正绕过独立 App,直接以短信方式提供服务,可记忆上下文、连接已有应用并代为完成任务,如安排日程、订餐、购物和发邮件。Instinct 在 9 月完成 10 亿美元融资、估值达 100 亿美元,并开始为用户分配专属邮箱地址、支持代打电话,目前仍处内测。

  2. The Verge · AI58

    Meta 开源代码,让用户自制 Muse AI 硬件

    Meta 开源了让用户自制 Muse AI 硬件的代码,Muse 是其新的 AI 智能体。官方建议的玩法包括把 Muse 装到彩色 E Ink 屏上显示提醒、装到 HDMI 棒上投到大屏,或装到小触摸屏上做成类似 DIY Muse Charm 的设备,用户可用现成 ESP32 板或 Raspberry Pi 配合其 SDK 连接屏幕、按钮和传感器。

  3. The Verge · AI62

    Apple 将限制 Mac 全盘访问权限,称 AI 智能体大幅增加风险

    Apple 宣布将在 macOS 上为全盘访问权限增加新的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用全盘访问的方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史等内容,而随着 AI 智能体能力与自主性增强,这类访问带来的风险会大幅上升。Apple 未说明该更新的具体推出时间。

10月2日周五
  1. MIT Technology Review · AI12

    用自主 AI 重新定义企业智能:MIT Technology Review 报告解析“智能体转型”

    MIT Technology Review 报告提出企业 AI 正从工具转向“智能体转型”(agentic shift),核心是实时连接人、流程与数据,并配套治理与控制能力。报告称 2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未靠 AI 实现收入增长。报告建议重建数据基础设施、以可组合架构替代固定技术栈,并解决 AI 主权问题。

  2. AWS Machine Learning Blog36

    用 Amazon Quick 和 Adjudicated Query 模式批量审查数千份租约合规性

    亚马逊云科技提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责将自然语言转为固定类型操作调用并转述结果。该模式通过完整性回执断言"合规+违规+模糊+不可读=已扫描",确保 50,000 份跨州租约的审查可证明无遗漏且可辩护,适用于制裁筛查、保险理赔等高风险合规场景。

  3. AWS Machine Learning Blog60

    在 Amazon SageMaker AI 上用多轮 RL 微调搜索智能体

    AWS 团队介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。

    推荐理由:AWS 团队公开了用 SageMaker AI 多轮 RL 微调搜索智能体的完整配置与四个基准的实测对比,可迁移到自有检索场景。

  4. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者应强化三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以添加认证流程为例,展示开发者从自己写代码转向定义任务、审查多个智能体输出并做技术决策。GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型对计划、代码和测试进行批判性审查。