Mistral AI 推出 Shieldstral 3B 模型用于 AI 安全审核
Mistral AI 推出 Shieldstral,一款面向 AI 安全审核的 3B 参数多模态分类模型。论文称,该模型在文本安全基准上可达到或超过参数规模近 7 倍的模型,并在多模态安全分类任务上取得新的最佳结果。
CATEGORY
整理可复现的 AI 工具、模型、API 与技术实践。
159 篇已发布内容Mistral AI 推出 Shieldstral,一款面向 AI 安全审核的 3B 参数多模态分类模型。论文称,该模型在文本安全基准上可达到或超过参数规模近 7 倍的模型,并在多模态安全分类任务上取得新的最佳结果。
Y Combinator 开源了名为 QM 的多人 Agent Harness,试图通过作用域隔离、持久化沙箱、身份绑定和分级安全策略,解决企业在规模化使用 Agent 时面临的权限、数据和审计问题。
WorkBuddy 近期升级资料库相关能力,支持用户通过自然语言生成、编辑和发布 HTML 页面,并让页面与 CSV 数据保持同步。雷峰网的实际测试显示,HTML 由一次性生成结果,开始转向可持续修改、多人协作和再次调用的工作界面。
面向电商 Agent 的 RealReplicaBench 将评测重点从单步答题转向真实业务任务的完整交付。在 107 个商业任务中,参评模型最高得分为 56.1 分,所有模型均未达到 60 分。
AI 视频模型正在降低画面生成门槛,但复杂镜头中的机位、走位、空间关系和节奏,仍难以仅靠 Prompt 精确表达。爱范儿对 updream 预演台的体验显示,面向 AI 视频工作流的 Blender 类工具,可能成为连接创作者意图与生成模型的重要控制层。
智谱 GLM-5.3 在一套由 GPT-5.6 设计的离线编程测试中完成五项任务并获得满分。报道同时指出,该测试规模较小,结果不能直接等同于模型在大型真实工程中的综合能力。
Netflix 公开介绍了一套内部 LLM 服务平台,将 vLLM 作为推理引擎,并与 NVIDIA Triton Inference Server 及既有 Model Scoring Service 集成,为不同类型的模型和调用方提供统一的部署与推理入口。
华为2012实验室大模型系统工程技术专家李柏潮将在AICon深圳分享盘古模型面向昇腾平台的通信优化实践,重点涉及MoE模型的AllToAll通信,以及超长上下文推理中的KV Cache传输。
Dropbox 分享了一套将 Model Context Protocol(MCP)、Dash 和基础大模型结合起来的工程方案:在 Pull Request 进入代码审查时,自动检索相关威胁模型和安全要求,并将其与代码变更进行比对,帮助审查人员发现设计意图与实际实现之间的安全差距。
甲骨文正在把企业 AI 战略延伸到数据库、智能体运行环境、GPU 基础设施和多云商业模式。其公开方案显示,企业可以在靠近业务数据的位置构建和部署智能体,同时通过 GPU 加速向量索引,并用跨云统一额度简化采购与成本管理。
Instacart 推出名为 Blueberry 的 AI 辅助事故响应系统,为值班工程师自动汇总告警、日志、部署信息和历史事故数据,并在 Slack 线程中生成根因假设。
2026 年菲尔兹奖得主雅各布·齐默尔曼认为,AI 可能在未来几年内超过人类数学家。相关讨论显示,当前 AI 探索数学问题的一种重要方式,是让多个模型围绕猜想提出质疑、寻找反例并反复验证。