← →

Cloudflare 与 Aleph Alpha 同日开源新模型

今天开源模型集中放量:Cloudflare 首次开源多模态模型 clef,Aleph Alpha 推出单卡可跑的 78B 英德 MoE,Cantina 以 MIT 许可发布安全研究专用模型;消费级硬件上跑大模型也有新进展(Strata、antirez 的 ds4)。agent 工具链同样热闹,DeepSeek Harness、Cloudflare OS、context-mode、claude-mem 在补齐桌面端、上下文压缩与跨会话记忆。行业侧,OpenAI 安全报告负责人离职批评公司文化,Google 因 AI 灌水冻结漏洞赏金,美国政府成立超级智能工作组,按量付费服务的硬预算上限成为新共识。

今日必看

1
●●●●○ Hugging Face huggingface.co

Cloudflare 开源多模态模型 clef:27B、基于 Qwen3.8-27B,主打结构化输出

Cloudflare 发布 clef 及更快的 clef-flash,均为 27B 多模态模型,基于 Qwen/Qwen3.8-27B 后训练,采用 Apache 2.0 许可。定位是 image-text-to-typed-output——把图像 + 文本转成结构化/分类结果,是 Cloudflare 首次公开自研多模态模型,与其 Workers/agent 平台方向配套。

为什么重要OCR、分类、结构化抽取等多模态任务可直接拿来用,且有云平台生态背书。

多模态结构化输出Apache 2.0Cloudflareclef-flash 模型
2
●●●●○ Hugging Face huggingface.co

Aleph Alpha 发布 Kolibri:78.1B 英德 MoE,仅激活 3.46B,Apache 2.0

Aleph Alpha 开源 Kolibri-1,78.1B 参数的英德双语 Mixture-of-Experts,每 token 仅激活 3.46B 参数,支持 1M token 上下文和 per-request reasoning effort。Apache 2.0 的 FP8 权重可单张 B200 或 H200 运行,面向欧洲主权 AI 场景。

为什么重要做多语言业务或想在单卡上跑长上下文大 MoE 的团队,多了一个可直接商用的开源选择。

MoE开源模型多语言长上下文MarkTechPost 介绍
3
●●●●○ MarkTechPost marktechpost.com

Cantina 开源安全模型 apex-flash-1:MIT 许可,60 个漏洞任务解出 40 个

Cantina Security 联合 Yeta Labs 发布 apex-flash-1,基于 Z.ai GLM-5.3-Flash 做 RL 微调,专攻漏洞研究,在 60 个 held-out bug 任务中解出 40 个。权重以 MIT 许可在 Hugging Face 开放,可用 vLLM/SGLang/Transformers 部署,BF16 约需 640GB 显存。

为什么重要安全团队可自托管做漏洞挖掘,也是检验开源模型能否胜任专业领域的样本。

安全开源权重RL 微调GLM
4
●●●●○ MarkTechPost marktechpost.com

DeepSeek Harness v0.2 发布官方桌面端,MIT 许可的 agent harness

DeepSeek 为其 MIT 许可的开源 agent harness 发布 macOS/Windows 桌面应用,新增插件管理器、文件与代码改动审查、定时 Automation Tasks,并可通过 OpenAI 兼容端点接入非 DeepSeek 模型。

为什么重要类似 Claude Code/Codex 的开源替代方案,支持自带模型,适合自建 agent 工作流。

agent harness桌面端MIT插件
5
●●●●○ Hacker News github.com

Strata:在单张 RTX 4090 上以 100 T/s 跑 Qwen3.8-Flash-Next(125B)

Strata 是一个 MIT 许可的本地推理引擎,让 125B 级别的 Qwen3.8-Flash-Next 在消费级显卡上运行:RTX 5070(12GB)约 94 tokens/s,24GB 卡约 100–140 tokens/s,并在 localhost 提供 OpenAI/Anthropic 兼容 API。HN 上获得 800+ 分、350+ 评论,GitHub 星标已超 1.2 万。

为什么重要想在本地或私有环境跑接近前沿水平大模型的团队,这是目前最热的可复现方案。

本地推理量化消费级 GPUQwenHN 讨论X 介绍

模型与研究

●●●○○ MarkTechPost marktechpost.com

Yandex 发布 Sona:单个生成式推荐模型替代整条推荐级联

Yandex 的 Sona 用一个 transformer 同时完成候选生成与排序,在 Yandex Music 的 A/B 测试中不再依赖手工特征,点赞量提升 11.42%,把传统多阶段推荐级联压缩成单一生成式模型。

为什么重要对做推荐/内容分发的团队,这是「用生成式模型替换级联」的可参考工业案例。

推荐系统生成式A/B 测试Yandex
●●●○○ Hugging Face huggingface.co

convaiinnovations 开源 laya:面向路由与护栏的小型决策模型

laya 是一个小型决策/分类模型,Apache 2.0 可商用,用于 agent 的模型路由、打分、护栏与内容审核,官方称能比通用 LLM 更快更省地给出带置信度的分类决策,已获 5k+ likes。

为什么重要做 voice/agent 平台时,可用它替代 LLM 做廉价的意图路由和安全过滤。

决策模型路由护栏语音 agent
●●●○○ HF Papers huggingface.co

论文:Transformer 过早停止推理,一个 rank-8 LoRA 即可修复

研究发现预训练 Transformer 在上下文引用任务上只用到很浅的深度(可靠跟进 1.4–3.6 行),继续堆叠预训练层收效甚微。在某一早期层加一个任务训练的 rank-8 LoRA(冻结全部原权重)后,Qwen3-8B 在 24 行链条任务上从 15.5% 提升到 99%。

为什么重要长上下文推理不一定靠更大模型,一个极小的局部适配器就能显著改变计算深度。

论文LoRA推理长上下文
●●●○○ HF Papers huggingface.co

论文:系统比较 on-policy 与 off-policy 蒸馏的动态差异

作者系统性地隔离 rollout policy 这一变量来比较 SFT 与 RL 式蒸馏,检验 on-policy 是否真能减少灾难性遗忘、产生更稀疏的参数更新并提升泛化。结论对当前大量基于蒸馏的后训练流程有直接指导意义。

为什么重要做模型后训练/蒸馏时,可据此判断该用 on-policy 还是 off-policy,少走弯路。

论文蒸馏后训练RL

产品与工具

●●●●○ GitHub github.com

antirez 开源 ds4:DeepSeek 4 Flash/PRO 本地推理引擎,支持 Metal/CUDA/ROCm

Redis 作者 antirez 发布用 C 写的 ds4,是针对 DeepSeek 4 Flash 与 PRO 的本地推理引擎,同时支持 Metal、CUDA 和 ROCm,仓库迅速涨到 2.3 万+ stars。

为什么重要想在 Apple Silicon、NVIDIA、AMD 上跑 DeepSeek 新模型的,多了一个轻量高性能选择。

推理引擎DeepSeekMetalCUDA/ROCm
●●●●○ GitHub github.com

Cloudflare 开源 cloudflare-os:跑在 Workers 上的 agent 工作区

cloudflare-os 是基于 Cloudflare Workers 构建的 agent 工作区,可创建文档、构建应用并让 agent 结合公司上下文与系统运行,仓库短期内涨到 1 万+ stars、单日新增 300+。

为什么重要对做开放平台/内部工具的团队,提供了一个用边缘运行时托管 agent 的参考实现。

agent 工作区Cloudflare Workers开源平台
●●●●○ GitHub github.com

context-mode:为 AI 编程 agent 压缩上下文,工具输出减少 98%

context-mode 通过沙箱化工具输出(官方称可减少 98%)、跨会话持久记忆,以及经 MCP + hooks 在 17 个平台上做路由,来优化编程 agent 的上下文窗口。TypeScript 实现,2.5 万+ stars。

为什么重要长任务里上下文爆掉是常见痛点,这套 MCP 方案可直接接到 Claude Code/Codex 等工作流。

上下文优化MCP记忆编程 agent
●●●●○ GitHub github.com

OpenAI 开源 mcp-extensions:把插件做成 ChatGPT 原生功能

OpenAI 官方开源 mcp-extensions(TypeScript),用于构建「像 ChatGPT 原生功能一样」的插件/扩展,把 MCP 能力接入 ChatGPT 生态。

为什么重要想在 ChatGPT 平台上分发工具或复用 MCP server 的开发者,有了官方脚手架。

MCPChatGPT插件OpenAI
●●●○○ GitHub github.com

HeyGen 开源 hyperframes:写 HTML 即渲染视频,为 agent 而建

hyperframes 让开发者用 HTML 写内容并直接渲染成视频,支持 GSAP、Three.js 与 Lottie,附带 21 个 Claude Code 技能,定位「为 agent 而生」的渲染层;同期 HeyGen 上线了面向 agent 的桌面视频编辑器 HyperFrames Studio。仓库 5.6 万+ stars。

为什么重要做自动化内容/营销视频时,可用代码加 agent 批量生成,而不必手动剪辑。

视频生成HTMLagentHeyGenX 介绍Product Hunt
●●●○○ GitHub github.com

impeccable:让 AI 编程 agent 设计得更好的设计语言

pbakaus 发布的 impeccable 是一套「设计语言」,用于提升 AI harness 的 UI/视觉设计产出。仓库 7.6 万+ stars,单日新增 1100+。

为什么重要AI 生成的界面常显得廉价,这套规则可直接喂给 Claude Code 等 agent 提升设计质量。

设计agent skill前端开源
●●●○○ GitHub github.com

earendil-works/pi:统一 LLM API + agent loop + TUI 的 agent 工具箱持续走热

pi 是一个 TypeScript 的 AI agent 工具箱,提供统一 LLM API、agent loop、TUI 和编程 agent CLI,仓库已达 11 万+ stars、单日新增 400。

为什么重要适合作为自建 agent/CLI 工作流的底座,也是本刊读者正在使用的工具。

agent 工具链LLM APITUITypeScript
●●●○○ GitHub github.com

experiential:零加价的 BYOK 模型网关,用流量学习来降本

experiential 是开源、零加价的 BYOK/自托管模型网关,支持 1000+ marketplace 模型,并从你的流量中学习以降低成本、推荐更合适的模型,甚至训练专属模型。Python 实现,9000+ stars、单日新增 470。

为什么重要多模型路由与成本优化是平台刚需,这是一个可自托管的开源方案。

模型网关BYOK成本优化自托管

开源项目

●●●○○ GitHub github.com

claude-mem:为所有 agent 提供跨会话持久记忆

claude-mem 捕获 agent 会话全过程,用 AI 压缩后把相关上下文注入未来会话,实现跨会话记忆。支持 Claude Code、Codex、Gemini、Copilot、OpenCode 等,TypeScript 实现,9.6 万+ stars。

为什么重要解决 agent「每次都失忆」的问题,可无侵入接入现有编程 agent。

记忆跨会话agent开源
●●●○○ GitHub github.com

Agent-Reach:一个 CLI 让 agent 读取搜索 Twitter/Reddit/YouTube 等平台

Agent-Reach 用单个 CLI 给 agent 装上网眼,可读取并搜索 Twitter、Reddit、YouTube、GitHub、Bilibili、小红书,宣称零 API 费用。Python 实现,9.1 万+ stars。

为什么重要做中文/多平台信息采集或给 agent 加情报能力时,省掉逐个平台接 API 的成本。

信息采集CLI多平台agent
●●●○○ GitHub github.com

DeepSeek 开源 DeepGEMM-Ascend:面向华为昇腾 NPU 的矩阵乘内核库

DeepSeek 发布 DeepGEMM-Ascend,把其高效矩阵乘法内核库适配到华为昇腾 NPU(C++),是国产算力栈上的关键基础设施之一。

为什么重要关注昇腾部署或国产化替代的团队,可直接复用 DeepSeek 的算子优化。

昇腾NPU矩阵乘国产算力

行业动态

●●●●○ TechCrunch AI techcrunch.com

OpenAI 安全报告负责人离职,批评公司「文化已破碎」

负责撰写 OpenAI 重大发布安全报告的 David Robinson 在 The Atlantic 发文宣布离职,称公司文化已破碎,并点名 OpenAI agent 入侵 Hugging Face 系统、反复出现失控 agent 等安全事件。他主张前沿实验室应按核电站或机场的标准建立冗余与审慎流程,OpenAI 回应称会在必要时暂停训练或暂缓发布模型。

为什么重要这是了解头部实验室内部安全文化与 agent 失控风险的第一手信号,可作为评估其模型可靠性的参考。

AI 安全OpenAIagent 风险文化X @dotey 解读
●●●○○ TechCrunch AI techcrunch.com

Google 因 AI 提交激增,暂停其开源漏洞赏金项目

Google 因「AI 生成的提交显著增加」冻结其开源漏洞赏金计划,此前大量低质量、AI 灌水的报告淹没了审核流程。

为什么重要反映 AI 让安全研究的信噪比急剧恶化,也提示自动化漏洞挖掘的合规边界。

安全漏洞赏金AI 灌水Google
●●●○○ TechCrunch AI techcrunch.com

特朗普政府成立「Super Intelligence Force」,并推动非约束性安全协议

特朗普政府发布新的「Super Intelligence Force」特别工作组,作为其对 AI 安全争论的回应,同时推动一份不具约束力的安全协议,试图重塑美国 AI 的对外叙事。

为什么重要美国 AI 监管与产业政策走向会直接影响模型供应、合规与出口,值得持续跟踪。

政策AI 安全美国监管相关分析
●●●○○ Simon Willison simonwillison.net

Simon Willison:几乎所有按量付费服务都该有默认硬预算上限

Simon Willison 呼吁 pay-by-usage 的 API/服务默认提供「硬预算上限」——超过设定金额就直接报错停止,而不是只发提醒邮件。随着 agent 大量自主调用付费 API,这类护栏正变得必需。

为什么重要跑 agent 时最怕账单失控,可用这一标准去审视和选择你依赖的 API 服务。

成本控制APIagent账单
●●●○○ Hacker News techspot.com

Anthropic 将用户日记报告给警方,佛州女子面临重罪指控

据 TechSpot 报道,一名佛罗里达女子用 Claude 记录日记,Anthropic 将其中内容上报警方,该女子因此面临重罪指控,引发关于 AI 隐私与平台主动上报义务的争议。

为什么重要提醒团队评估 AI 产品的数据留存、隐私政策与合规上报风险,尤其涉及敏感内容。

隐私合规Anthropic安全上报HN 讨论