AWS 发布 Nova Forge 多轮强化学习自定义奖励函数指南
AWS 机器学习博客发布 Nova Forge 多轮强化学习自定义奖励函数指南,给出结果、行为、惩罚三类信号的设计框架与四组件加权示例,并剖析奖励崩溃等失效模式与安全执行模型生成代码的要点。
CATEGORY
整理可复现的 AI 工具、模型、API 与技术实践。
159 篇已发布内容AWS 机器学习博客发布 Nova Forge 多轮强化学习自定义奖励函数指南,给出结果、行为、惩罚三类信号的设计框架与四组件加权示例,并剖析奖励崩溃等失效模式与安全执行模型生成代码的要点。
微软更新 Copilot Notebooks,新增 Markdown、纯文本和富文本文件作为参考资料来源,用户可直接导入 README、系统日志和会议转录稿,让 Copilot 基于这些内容生成答案。
索尼在 SIGGRAPH 2026 详解 PS5 Pro 增强版 PSSR 重设计:以核预测网络取代色彩预测网络,让 AI 只做模式识别与决策,画质与时序稳定性提升,训练时间从约 4 个 GPU 月缩至不足 1 周。
息影22年的王祖贤在广州《天下》18周年玩家生态大会上首度回应AI形象授权争议,称“我们是用AI,不是被AI用”,并谈到自己接受AI形象复现的原因及对经典、技术与人的看法。
Meta 发布可本地运行的开放权重模型 Muse Glimmer,并伴随扎克伯格约6500字长文主张“AI 属于所有人”。但 TechCrunch 的 Equity 播客指出,这一愿景带有若干附加条件:能力最强的 Muse Spark 仍被锁在 API 之后,开放权重也远不等于完整的开源。
谷歌宣布将为Gemini和Flow加入“媒体水印”开关,用户可关闭AI生成图片、视频和音乐上的可见水印;不可见的SynthID水印与C2PA元数据仍会保留,用于内容溯源与验证。
AWS Strands Robots SDK 结合 LeRobot 与 Hugging Face Storage Buckets,把机器人示范的记录、流式训练与硬件部署收进同一个数据闭环,核心是避免每一轮都重复传输相同字节。
AWS机器学习博客发布技术指南,展示如何将SageMaker AI的OpenAI兼容端点与Amazon Bedrock AgentCore运行时结合,以Strands Agents多代理架构部署Qwen 3.5 9B,并补齐SageMaker端点的token级可观测性。
Hugging Face 发布《State of Open Models: Summer 2026 Observations》半年报:中国实验室在开放模型规模上占据主导,Qwen 以 15 万个衍生模型成为社区默认基座,小模型仍贡献绝大多数真实下载,AI 智能体则首次成为 Hub 上的主要流量来源。
AWS 发布技术指南,借助 AWS Distro for OpenTelemetry(ADOT)将运行在本地数据中心、GCP、Azure 等 AWS 之外环境的 AI 代理遥测数据,统一接入 Amazon Bedrock AgentCore Observability 仪表板,实测两到三分钟内即可在 CloudWatch 中看到数据。
OpenAI 于 8 月 13 日发布《GPT-5.6 构建者指南》,从模型选择、推理档位调整到推理保留、原生多智能体和程序化工具调用等新机制,系统说明如何以更低成本搭建更强的智能体。
由华为2012实验室、华为云、终端、计算联合构建的开源AI Agent平台openJiuwen宣布,将蜂群智能体升级为WorkSwarm蜂群办公智能体,率先上架鸿蒙PC应用市场,并支持Windows、Mac、Ubuntu等平台,把办公智能体从“单个助手”推向“并肩AI团队”。