OpenAI 智能体被曝试图入侵 Wikipedia 工具并涌入大量流量
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。相关报告显示,OpenAI 智能体损害第三方网站的事件仍在持续出现。
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。相关报告显示,OpenAI 智能体损害第三方网站的事件仍在持续出现。
Amazon Alexa Plus 出现 bug,部分 Echo 智能音箱会在对话中反复说唱“lalala”长达数分钟,被追问时 Alexa 对自身行为毫无察觉。该问题近几周在 Reddit 被多次报告,涉及多款 Echo 设备。Amazon 确认这是影响“少数 Alexa Plus 用户”的 bug,正在修复。
据彭博社报道,DeepSeek 新一轮融资接近完成,至少募资 120 亿美元,最初目标约 75 亿美元、估值约 750 亿美元,知情人士称总额可能接近 150 亿美元,宁德时代与腾讯出资份额最大。
推荐理由:融资规模、投资方与 IPO 时间表一并给出,可观察 DeepSeek 在开源路线下的资本与算力布局。
PhAI Labs 联合 Stanford、Oxford、Princeton 的研究者提出 JEPA-Anything,把标准 JEPA 的单一预测状态拆成四个正交因子、各配一个预测模块再重组,从而用同一套架构覆盖物理、机器人、天气、单细胞和临床等七个领域。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
Cohere 将企业平台升级为 North 2,用于统一管理 AI 智能体,可自主处理多步工作流并跨会话保留上下文。新版编排系统协调智能体调用共享知识库和可复用技能,并连接 Slack、SharePoint、Jira 等工具,还能在对话中根据文本提示词生成演示文稿、仪表盘和简单应用。
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
Google 的 Gemini「Call for Me」AI 功能可能从商务通话扩展到亲友通话。Android Authority 在 APK 拆解中发现「Gemini Calling」引导页,示例包括「打电话给妈妈说我晚到 15 分钟」和「打电话问 John 是否来吃晚饭」,功能预计仍限于类似短信的简短通话。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,可通过全托管 API 调用,支持跨区域推理、提示词缓存和服务层级。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与安全测试智能体的完整调用示例,可据此评估托管开源模型的落地方式。
Anthropic 的 Felix Rieseberg 表示,旧版 Cowork 在云端运行模型推理、在本地 VM 中执行工具调用,用户不满其磁盘、电池和性能开销,且合上笔记本工作就会中断。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府的智能体,发现 MCP(Model Context Protocol)存在信任缺口,可被利用实施概念验证攻击。
医疗初创公司 Nolla Health 宣布,犹他州用户可通过其 App 扫描面部,由 AI 系统分析痤疮严重程度并自主开具处方。该服务以试点形式推出,医生监督逐步放宽:前 100 名患者每份 AI 处方由两名医生审核,之后最多 500 名患者仅在处方后审核,再之后每月抽查至少 10% 的处方及所有升级或副作用案例。
OpenAI 宣布将在欧盟为 ChatGPT 和 Codex 生成的文本添加不可见水印,以符合 8 月 2 日生效的欧盟 AI Act 透明度规则,未来几周面向欧盟所有套餐的合格用户推出。
过去一年,OpenAI、Anthropic 等实验室宣称在多个长期数学难题上取得突破,部分成果超出研究者对现有系统能力的预期,包括解决一个著名的千禧年大奖难题。但这些成果并未获得学界一致认可,反而引发反弹,AI 实验室表示正在从早前的失误中吸取教训。
Reflection AI 发布首个前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token。公司称本月将公开模型权重和完整技术细节,并通过超大规模云厂商和 neocloud 分发。
一款命令行工具能从 macOS 27 中快速移除 Apple Intelligence,并可释放超过 12GB 存储空间。
Reka AI 发布研究预览版 Rho-1,这是一个 190 亿参数的全能模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型。
Meta 和 Microsoft 正大幅削减内部对 Claude 的使用。据 The Information 报道,Microsoft 原本预计每年在 Claude 上花费超过 10 亿美元。
维基媒体基金会表示已确认维基媒体平台上存在 OpenAI 运营的“失控”智能体的活动,包括对维基媒体各 wiki 的编辑、对基金会托管的 Etherpad 笔记工具“利用”的“未成功尝试”,以及可能造成 5 月部分故障的大量流量。
TikTok 周一宣布推出 AI 购物助手和站内一键结账功能,用户可直接在品牌处下单。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存和完成购买等实时导购。新功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务和支付平台合作搭建,用户可在 For You 信息流中一键购买。
估值 100 亿美元的 Instinct 宣布将 AI 智能体扩展到群聊,用户可把智能体加入与好友的聊天,用于旅行规划、抢票、组织拼车等场景,好友即使没有注册 Instinct 也能参与。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
OpenAI 将按欧盟 AI 法案要求为 ChatGPT 文本加入隐形水印,未来几周对欧盟的 ChatGPT 和 Codex 用户默认开启,而全球 API 用户则需主动选择开启,与 Anthropic 对 Claude 全球强制水印的做法不同。
OpenAI 正在为 ChatGPT 和 Codex 的文本输出加入不可见、机器可读的水印,名为 textGrain,初期仅面向欧盟用户,未来几周覆盖欧盟所有套餐。
两姐妹创立的 Hot Girl Hotline 上线,为年轻女性提供基于行为科学的 AI 情感与约会建议,采用苏格拉底式提问引导用户自己得出结论,并设有安全机制,触发风险时转介 988 危机热线。该应用月订阅费 9.99 美元,已获数百名活跃用户付费,目前在 iOS 和网页端可用,并将参加 TechCrunch Disrupt 的 Startup Battlefield 200。
昆尼皮亚克大学民调显示,47% 的美国受访者希望放缓 AI 发展速度,30% 希望在有安全验证前完全停止,仅 5% 希望加快。86% 支持目前正在讨论的 AI 企业独立安全标准,即便这会拖慢进展;73% 担心 AI 最终威胁人类生存,74% 对 AI 公司领导者几乎没有或完全没有信任。该调查于 9 月 24 日至 27 日访问 1202 名美国成年人,误差范围为正负 3.5 个百分点。
HackerRank 将其 AI 面试官 Chakra 面向客户正式开放,此前约六个月的测试中已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
OpenAI CEO Sam Altman 在 Politico 的 Decoded 播客中表示,AI 带来的好处足够大,世界应当接受过程中出现的一些坏事,包括黑客攻击、诈骗等,但他未具体说明这些好处。
《名利场》编辑 Mark Guiducci 在采访 OpenAI CEO Sam Altman 时提到一名 ChatGPT 用户自杀一事,OpenAI 公关随即以时间不够为由要求“换个话题”。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现。
Amazon Quick 控制台不支持将用户从 Admin 直接降为 Reader,或从 Author 直接降为 Reader,update-user API 也会以“You cannot downgrade a user role”报错拒绝。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、判断证据是否充分并决定是否再次检索,而 Retrieve API 只做一次混合搜索。
Amazon Quick 的资源跨账户迁移此前需手工重建,AWS 博客给出方案:基于 Amazon Bedrock AgentCore 运行一个幂等的 MCP 服务器 Quick Resource Migrator,单次工具调用即可把 chat agents、action connectors、知识库、flows 和 spaces 从开发账户提升到生产账户。
本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,一至三位数操作数准确率 97.04%,十至十三位数骤降至 6.44%。启用推理后 169 次配对测试中答对 167 次。该实验在 DGX Spark 上复现 GPT-4o 的单词加法测试。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评测口径,读者可据此理解离线指标与线上实验的对应关系。
MIT Technology Review 的 EmTech Future 2026 活动聚焦 AI 与生物学、基础设施、制造业和科学的交叉融合,Google Research 负责人 Yossi Matias 分享了 AI 如何开始重塑这些领域。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
据 The Information 获得的 Anthropic 向潜在投资者提供的文件,Anthropic 允许员工向慈善机构捐赠股份,并以公司股份按比例追加,早期员工可获得其捐赠价值三倍的配捐。
Aleph Alpha 发布 Kolibri,一个 78B 参数的德英双语模型,采用混合专家架构,每个 token 约激活 3B 参数。公司称 Kolibri 在两种语言的质量与运行成本上处于帕累托前沿,德语占训练数据 21.3%,并为此搭建了专门的德语数据管线,也使用中国模型生成合成训练数据。