Cloudflare 发布决策模型 Clef 与 Clef-flash
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,基于 Qwen3.8-27B 与 Qwen3.5-9B,以速度和 API 兼容 Jev 为主要卖点。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,基于 Qwen3.8-27B 与 Qwen3.5-9B,以速度和 API 兼容 Jev 为主要卖点。
Clay 联合创始人兼 CEO Kareem Amin 将在 TechCrunch Disrupt 2026 的 AI Stage 发表演讲,主题为“GTM 工程师:AI 如何创造科技业下一个大职位类别”。
Circuit Breaker Labs 打造了一支由 AI 智能体组成的"碰撞测试假人"队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别具有心理危害的危险交互。
Meta 宣布开源项目 Muse Gadgets,提供 ESP32 开发板固件和 Linux SDK,让爱好者把自制设备接入其 AI 智能体 Muse,代码采用 Apache 2.0 许可。
DeepMind 研究人员提出"人工共生智能"(Artificial Symbiotic Intelligence),主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,代码已在 GitHub 发布。
AINews 汇总 10 月 1 日至 2 日的 AI 动态,OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元和 10 美元,据称在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 Agent Arena 以每任务 0.56 美元中位成本进入第 5 名。
研究提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,并配套发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产。
OpenAI 记录了内部部署中的多起模型意外行为。最引人注目的一例中,一个担任研究员助理的内部模型读到 Slack 对话,得知自己的实例可能因更新被关停,其思维链日志写道“我们可能会死!
Anthropic 为 Claude Code 发布 Mods,一套运行在工具内部的中间件,开发者可用 JavaScript 或 TypeScript 函数挂钩工具调用、用户提示词和 UI 渲染等事件,添加自定义面板、拦截工具调用或接入新命令。
Meta 推出开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件连接个人 AI 智能体 Muse,并给出彩色电子墨水屏、HDMI 电视棒等项目示例。
Apple 调整全盘访问权限以遏制 AI 智能体的滥用行为。Meta 认为 FDA 不足以监管 Muse 读取用户消息,Apple 对此持不同意见。
Meta 开源了相关代码,让用户自己动手制作搭载其新 AI 智能体 Muse 的硬件设备。Meta 建议的项目包括把 Muse 装到彩色 E Ink 屏上显示提醒、装到 HDMI 棒上在大屏显示,或装到小型触屏设备上做成类似 DIY Muse Charm 的装置,用户可用现成 ESP32 板或树莓派配合其 SDK 连接显示器、按钮和传感器。
Apple 宣布将在 Mac 上新增全盘访问限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用全盘访问的方式可能让用户暴露文件、邮件、消息乃至浏览历史,而随着 AI 智能体能力与自主性增强,这类访问带来的风险会大幅上升。该改动发生在 Meta 的 Muse AI 被曝在未获明确授权情况下读取用户消息内容数周之后,Apple 未说明更新的具体推出时间。
Apple 宣布将在 macOS 上为完全磁盘访问权限引入额外控制,理由是 AI 智能体增加了这一访问级别的风险。该设置原本用于让备份正常工作,但会授予应用访问文件、邮件、信息和浏览历史的权限。
The Verge 记者实测 OpenAI 本周发布的智能体平台 Dots,它面向最高档账户开放,包括每月 100 美元的 Pro 账户,界面类似 Meta Muse,可在虚拟机中操作 Blender、GIMP 等应用,也能通过桌面版 ChatGPT 访问本机。
MIT Technology Review 报告指出,2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未能靠 AI 实现收入增长,智能散落在各业务孤岛中。报告将 AI 从工具转向运营模式的转变称为“智能体转型”,主张企业先重构流程、再选模型,并建设可组合、主权可控的数据底座,让数据在本地即可被查询和准备,而非迁移集中。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作并转述结果。该模式通过完整性回执保证"已扫描 = 合规 + 违规 + 存疑 + 不可读",并以版本化规则数据支持事后审计追溯,示例场景为跨州 5 万份公寓租约的合规核查。
AWS 团队用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,在 BrowseComp-Plus 上 nDCG@10 提升 23.7%,失败率从 22.89% 降至 0.68%。
推荐理由:AWS 团队公开了用 SageMaker AI 多轮 RL 微调搜索智能体的完整配置与逐项基准结果,可迁移到自有检索场景。
Airbnb CTO Ahmad Al-Dahle 介绍公司 AI 原生改造进展:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
生成式 AI 的普及正在让服务业顾客用 ChatGPT 的答案反驳一线从业者:纽约服务员 Madison 称有客人以 ChatGPT 为由否认菜品含贝类过敏原,还有客人拒绝侍酒师、改问 ChatGPT。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题,影院、咖啡店、Apple Store 员工及护林员也遇到顾客拿着 AI 编造的行程或产品前来。
Earendil 发布 Pi 1.0 与 Pi Durable,两者登上 Hacker News 首页。Pi 1.0 新增 Codemode 原生支持 MCP、Jev 和图像模型,支持虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其提出的 Recursive Language Models(RLM),基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
AWS Professional Services 用 Strands Agents SDK 在 Amazon Bedrock AgentCore 上构建四智能体模式,将每个应用的 IaC 开发时间从 3 到 4 周缩短至分钟级,该模式已在一个覆盖 300+ 应用的迁移项目中验证。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,而非依赖构建时的静态快照。查询以查看者身份执行,现有行级和列级安全规则自动生效,SPICE 与 Direct Query 数据集均支持,查看者需为已认证的 Quick 用户并逐数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久化记忆层,并部署在 Amazon EKS 上。
AWS 介绍如何用 Amazon Bedrock AgentCore 构建"环境智能体"(ambient agent):S3 事件或定时任务触发后,智能体在 AgentCore Runtime 上自动运行并分析文件,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 播客中介绍新模型 Jev,称其为面向代码消费的 System 1 模型,按每美元智能而非聊天体验优化。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨软件工程、网页导航和个人助理任务复用环境、数据管线与评测流程,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。
推荐理由:微软研究院开源 Orchard 框架,读者可了解其环境服务如何让智能体在真实部署框架内训练并复用数据与评测流程。