夜雨聆风学习资料网

ARTICLE · 1117082

AI 早报 10.03|BFL 发布 FLUX 3 Image 支持多轮定点编辑

AI 早报 10.03|BFL 发布 FLUX 3 Image 支持多轮定点编辑

今日看点

  1. 1. Black Forest Labs 发布 FLUX 3 Image,支持多轮定点编辑
  2. 2. Apple 为 macOS 全盘访问权限增加新控制,称 AI agents 抬高风险
  3. 3. NVIDIA 推 64GB DGX Spark,10 月 23 日上市售 4999 美元

头条|BFL 发布 FLUX 3 Image,支持多轮定点编辑

官方 · The Decoder · 10-02 · 另见 X @bfl_ai · 另见 X @fal

BFL 发布 FLUX 3 Image,支持多轮定点编辑

图源:The Decoder

Black Forest Labs 发布了 FLUX 3 Image,是 Flux 3 模型家族的图像部分。据 The Decoder 报道,BFL 声称该模型支持多步编辑,且不会改动画面其他部分,能力覆盖 text-to-image、image-to-image、文字渲染和写实风格。官方提供免费 demo 可直接试用,X 上 @bfl_ai、@fal、@robrombach 也同步发布了相关信息。

细节与数字:用户可以用 bounding boxes 构图,最多可放入十张参考图,输出最高 4K。API 访问到 10 月 8 日为 50 percent off(原文只给了折扣幅度,没有给原价)。企业可以授权 commercial weights,在自己的基础设施上运行和微调模型;open-weight 版本预计在未来几周发布。发布前不久,Ideogram 也公布了主打编辑的 4.5 版本,同样计划不久后以开放权重形式推出。

对工程师来说,现在能用的路径有三条:免费 demo 验证定点编辑效果,API 在 10 月 8 日前接入(折扣期内成本更低),需要私有部署或微调的公司走 commercial weights 授权。

局限和待验证的地方:多步编辑不影响画面其余部分目前只是 BFL 的说法,原文没有给出任何基准分数、生成速度、上下文长度或具体价格数字;open-weight 版本尚未发布,许可证条款和确切时间未说明;commercial weights 的授权条件原文也未展开。Ideogram 4.5 与 FLUX 3 Image 的实际编辑效果对比,也需要等两边权重都可获取后再测。

原文:The model supports multi-step edits without changing other parts of the image, BFL claims, and covers text-to-image, image-to-image, text rendering, and photorealism.

我的看法:前一天 Ideogram 4.5、今天 FLUX 3 Image,两家都把卖点放在“多轮编辑不动其他区域”上,局部编辑正在变成图像模型的基本功,而不只是出一张好看的图。FLUX 3 现在能用免费 demo 和 API 试,要私有部署还能谈 commercial weights 授权,比目前只有平台和 API 的 Ideogram 4.5 多一条路。但 BFL 这次没给基准、速度和原价,只说 10 月 8 日前 API 五折,折扣结束后多少钱还不知道;Ideogram 至少公布了每张 0.8–22 美分的分档价。值得先拿同一组商品图连续做三五轮局部修改,看非编辑区域有没有漂移、图里的文字稳不稳,再算两家的单张成本;open-weight 版本出来后,再看许可证能不能用在商业项目里。

要闻

1. Apple 收紧 macOS 全盘访问权限

官方 · TechCrunch · 10-03 · 另见 The Verge AI · 另见 Ars Technica AI

Apple 收紧 macOS 全盘访问权限

图源:TechCrunch

Apple 宣布为 macOS 的 Full Disk Access 增加新控制,称 AI agents 让这一权限级别的风险上升。该设置原本用于让备份正常工作,但会让 app 访问文件、邮件、消息甚至浏览历史。Apple 在开发者博客中说,未来只有用户“非常明确的操作”才能授予该权限;它未回应 TechCrunch 的询问。

原文:Some developers are using Full Disk Access in ways that could put users at risk, exposing everything on their systems…without users’ full knowledge and understanding

  • • 工程师视角:做桌面 agent 的团队要改授权引导:Full Disk Access 不能默认或静默获得,需设计非常明确的用户操作,并准备处理被拒权限。

2. NVIDIA 推 64GB DGX Spark,10 月 23 日上市

官方 · MarkTechPost · 10-03 · 另见 PCMAG · 另见 Reddit r/LocalLLaMA

NVIDIA 推 64GB DGX Spark,10 月 23 日上市

图源:MarkTechPost

NVIDIA 为 DGX Spark 增加 64GB 配置,由 Acer、ASUS、Dell、Gigabyte、HP、MSI 出货,2026 年 10 月 23 日上市,售价 4999 美元(PCMAG 报道)。芯片仍是 GB10 Grace Blackwell:20 核 Arm CPU、FP4 稀疏算力最高 1 petaFLOP、64GB 统一 LPDDR5x、273 GB/s 带宽、ConnectX-7 200GbE,单机最高支持 100B 参数。预装 DGX OS,含 PyTorch、Jupyter、Ollama。限制是 273 GB/s 带宽不适合百人并发的对话服务;要更大模型可选 128GB 款或把两台 64GB 集群成 128GB。

原文:The 64GB model keeps the same GB10 Grace Blackwell superchip, NVIDIA CUDA accelerated AI software stack, and ConnectX-7 networking as the original — updated with 64GB of unified LPDDR5x instead of 12…

  • • 工程师视角:能直接用:开箱即 DGX OS + PyTorch/Ollama,适合长输入短输出的常驻 agent、QLoRA 微调和本地评测,但 273 GB/s 带宽决定了它不适合高并发推理。

3. Meta 开源 Muse Gadgets 固件与 Linux SDK

官方 · Engadget · 10-03 · 另见 The Verge AI

Meta 开源 Muse Gadgets 固件与 Linux SDK

图源:Engadget

Meta 上线开源项目 Muse Gadgets:提供开源固件和 Linux SDK,让开发者把 Muse agent 装进自造硬件。官方举出的形态有专用 E Ink 显示屏、接电视的 HDMI dongle、类似 Muse Charm 的小型触屏配件,并开了项目专属 Discord 社区。Meta 自己也做了 USB-C 供电的 Muse Home Link,让 Muse 接入家庭网络,与电视、音箱及其他暴露 https 的设备通信,共制造 5000 个送给 Muse 订阅用户。

原文:Meta is providing the open source firmware and a Linux SDK that will enable people to bring the company's agent to hardware.

  • • 工程师视角:能用的部分目前只有开源固件与 Linux SDK 这一句方向性说明,适合想先把 Muse agent 接进 Linux 硬件的开发者关注;但原文没有给出仓库地址、支持的芯片型号、API 与网络协议细节,动手前需等官方文档和 Discord 里的补充。

4. DeepSeek 发布开源桌面版 Harness,处于预览阶段

社区 · deepseek.com · 10-02

DeepSeek 发布开源桌面版 Harness,处于预览阶段

图源:deepseek.com

DeepSeek 发布开源 harness DeepSeek Harness,基于 Cordis 的 “everything is a plugin” 架构,可作为桌面应用运行,也能从代码启动 web UI。功能覆盖日常办公(整理文件、分析数据、写文档、做幻灯片)、编码(探索仓库、修 bug、加功能、跑测试)、研究(查资料、核实事实、给出引用)和后台任务(跑脚本、批量处理文件、跟踪进度)。插件可安装,也能在 Creator mode 里用对话创建,官方演示中一个浮动番茄钟插件从创建到安装验证用时 5m 24s;此外还有 Scheduled tasks 插件与执行轨迹、工具调用详情的调试视图。官方说明它处于 preview,核心插件与 API 仍在演进。

原文:Run me as a desktop app or launch the web UI from code.

  • • 工程师视角:可以下载桌面版试用,也能从代码启动 web UI,适合本地跑 agent 编排、做日常任务与写插件扩展;注意官方标注为 preview,核心插件和 API 还在演进,接入前需自行评估稳定性。

5. Anthropic 投 1 亿美元培训 1 万名 FDE

官方 · Anthropic 官方新闻 · 10-02

Anthropic 投 1 亿美元培训 1 万名 FDE

图源:Anthropic 官方新闻

Anthropic 启动 Claude Frontier Academy,投入 1 亿美元,目标到 2027 年底培训 10,000 名 Frontier Deployed Engineer(FDE)。首个项目 FDE Residency 走医学培养路线:先与 Anthropic 工程师和持证讲师完成多日线下课程与模拟企业部署实操,通过后获 Claude Resident Engineer 徽章;再进入 12 周驻留期,在本组织主导真实 Claude 用例,结业考核通过后获 FDE 徽章,首批预计 2027 年初产生。首批 cohort 在旧金山、纽约和伦敦运行,参加需由所在组织提名。

原文:Backed by a $100 million commitment, Anthropic aims to train 10,000 Frontier Deployed Engineers (FDEs) by the end of 2027.

  • • 工程师视角:这是培训与认证项目,不是模型或 API 发布;个人无法直接报名,需由所在组织提名,面向有 LLM 构建经验、但不要求有 agent 经验的软件工程师,已落地的场景是在企业内把 Claude 用到生产系统。

6. Suno 上线 Speech:语音与背景音乐同轨生成

媒体 · The Verge AI · 10-02 · 另见 The Decoder

Suno 上线 Speech:语音与背景音乐同轨生成

图源:The Verge AI

在 AI 音乐之外,Suno 上线 Speech,按脚本或提示描述生成人声。功能已在网页端和移动端公测,可把配音与背景音乐一次生成在同一条音轨里。入口在 Create 标签下的 Speech,分 Simple(用提示词描述,例如“a pirate captain rallying his crew”)和 Advanced(写自定义脚本)两种模式,后者还能调 AI 声音性别、说话风格和每次生成的多样性;音频最长约 8 分钟,背景音乐可用开关关闭,只留干净人声。Suno 承认 beta 远非完美,会围绕用户反馈继续改进。

原文:Today, we’re expanding what’s possible in Suno with Speech: the first audio model that generates voice and music together as one cohesive track.

  • • 工程师视角:对工程师来说,这是一个已在网页端和移动端公测的语音生成入口,适合脚本驱动的短音频内容(最长约 8 分钟),带背景 music 同轨输出且可关闭;要注意它仍处 beta,官方自己说口音和停顿还不稳定,也没有给出 API 或代码层面的说明。

7. NVIDIA 开源 agent 技能扫描器 SkillSpector

代码 · GitHub Trending

NVIDIA 开源 agent 技能扫描器 SkillSpector

图源:GitHub Trending

NVIDIA 开源 SkillSpector,用于在安装前扫描 AI agent skills(Claude Code、Codex CLI、Gemini CLI 等使用)中的漏洞与恶意模式。原文称在 31,132 个 skill 的分析子集中,26.1% 含漏洞,5.2% 显示疑似恶意意图。工具内置 71 个漏洞模式、覆盖 17 个类别,两阶段分析为快速静态分析加可选 LLM 语义评估,支持 terminal、JSON、Markdown、SARIF 输出与 0–100 风险评分,可用 uv tool install 或 Docker 使用。

原文:In the 31,132-skill analyzed subset of the research dataset, 26.1% of skills contain vulnerabilities and 5.2% show likely malicious intent.

  • • 工程师视角:能直接用:uv tool install 或 Docker 即可跑,纯静态扫描可加 --no-llm 免凭据;LLM 语义分析需按表配置 provider 与 key(含 ollama、vLLM 等 OpenAI 兼容端点),注意远程/压缩包输入有 100 MiB 与 10,000 个 zip 条目的上限,超限会 fail closed 报 IngestLimitExceededError。

8. Upstage 发布 Solar Mini 4 推理模型

社区 · X @ArtificialAnlys · 10-02

Upstage 发布 Solar Mini 4 推理模型

图源:X @ArtificialAnlys

Upstage 发布 Solar Mini 4,为专有(proprietary)纯文本推理模型,自报 35B 总参 / 3B 激活,1M-token 上下文窗口,最大输出 262K。权重未发布,参数为厂商自报。定价为每百万 input/output/cache-hit token 分别 0.40/$0.01。Artificial Analysis 给出总分 24、长上下文推理 83%,但 Terminal-Bench 4.0 仅 1%。尽管输出速度 208 tokens/s,每任务约 88K 输出 token 导致平均完成时间 7.1 分钟,任务成本约为 GPT-6 Luna(max)的 5 倍。

原文:Solar Mini 4 : Upstage’s proprietary text-only reasoning model reports 35B total/3B active parameters, a 1M-token context window and 262K maximum output. Weights are not released, so parameter counts…

  • • 工程师视角:只能通过 API 使用、无权重可用:长上下文推理场景可评估,但终端/agent 类任务(Terminal-Bench 4.0 仅 1%)和每任务成本(约 Luna max 的 5 倍、平均 7.1 分钟完成任务)需要先按任务成本实测再决定是否接入。

9. Ollama v0.35.1 支持 Cloudflare Clef 决策模型

代码 · ollama/ollama · 10-03 · 另见 Hugging Face 热门模型 · 另见 The Decoder

Ollama v0.35.1 支持 Cloudflare Clef 决策模型

图源:The Decoder

Ollama v0.35.1 经 /v1/systemone 支持 Cloudflare 开源的决策模型 Clef(27B)与 Clef Flash(9B)。二者不生成文本,而是给预定义答案选项分配概率,供下游代码自动路由或升级;基于 Qwen,支持文本加图片。Cloudflare 称 Clef Flash 中位响应 39 毫秒、Clef 209 毫秒,Jev 超 524 毫秒。权重显存估算 BF16 18.8 GB / INT8 9.4 GB / INT4 4.7 GB,16 GB 卡可放 INT8;许可 apache-2.0。

原文:Ollama now supports Clef and Clef Flash, Cloudflare's new open-source decision models, through /v1/systemone.

  • • 显存估算:参数 9.4B|权重显存 BF16 18.8 GB / INT8 9.4 GB / INT4 4.7 GB(不含 KV cache 和激活)|16 GB 卡:INT8 权重放得下;24 GB 卡:BF16 权重放得下|上下文 262,144|许可证 apache-2.0
  • • 工程师视角:能在本地直接调:起 Ollama 后 curl /v1/systemone,传 state、images 和 questions 拿概率;注意 ollama show 与模型列表只报 decision 能力,客户端不会把它当通用 chat/tools/thinking 模型用,输出是概率不是文本。

10. DwarfStar 4:ds4 本地 LLM 推理引擎

社区 · DwarfStar 4 (ds4) · 10-03

DwarfStar 4:ds4 本地 LLM 推理引擎

图源:DwarfStar 4 (ds4)

DwarfStar 4(ds4)是一个用 C 写的窄范围本地推理引擎,面向高内存 Mac、CUDA 和 ROCm 机器,MIT 许可。官方支持 DeepSeek V4 / V4.1 Flash、GLM 5.x 与 Qwen3.8 Flash Next,含文本和视觉模型、本地 API、CLI 与原生 agent。它不做通用 GGUF runner,只跑 project GGUF,用非对称 2-bit 量化压缩 routed experts、保留关键共享路径。参考数据:M5 Max 128GB、q2、2048 tok 时 prefill 790.2 t/s、生成 39.4 t/s;65536 tok 时为 398.5 t/s 与 27.6 t/s。

原文:DwarfStar 4 is a narrow C inference engine for high-memory Mac, CUDA and ROCm machines.

  • • 工程师视角:可以下载 project GGUF 后按后端编译,用 ./ds4 聊天、./ds4-server 提供本地 API、./ds4-agent 跑常驻编码会话;注意通用 GGUF 文件不是它的目标,模型族仅限官方支持的那几种。

11. Cursor 开源官方插件仓库与插件规范

代码 · GitHub Trending

Cursor 开源官方插件仓库与插件规范

图源:GitHub Trending

Cursor 在 GitHub 开源官方插件仓库,覆盖 Developer Tools、Productivity、Integrations 三类,含 Cursor SDK、create-plugin(脚手架并校验新 agent 插件)、orchestrate、Ralph Loop、PR Review Canvas 以及 Gmail、GitHub、Playwright、Salesforce 等接入。仓库是 multi-plugin marketplace:根目录 .cursor-plugin/marketplace.json 列出全部插件,每个插件是仓库根目录下的独立目录、自带 .cursor-plugin/plugin.json manifest,目录内含 skills/、rules/、mcp.json、README.md、CHANGELOG.md、LICENSE,协议为 MIT。表中 Author 值对应各插件 plugin.json 的 author.name。

原文:Official Cursor plugins for popular developer tools, frameworks, and SaaS products. Each plugin is a standalone directory at the repository root with its own .cursor-plugin/plugin.json manifest.

  • • 工程师视角:可用:MIT 许可,README 和 manifest 都在仓库里,团队可照 create-plugin 的脚手架写自研插件并借 marketplace.json 组织成内部市场;接入前先读各插件 README、rules 与 mcp.json 配置,注意 Author 字段要与 plugin.json 的 author.name 一致。

12. Perplexity 开源 27B 决策模型

代码 · huggingface.co · 10-02

Perplexity 开源 27B 决策模型

图源:huggingface.co

Perplexity 开源决策模型 pplx-decider-v1-27b,基于 Qwen3.8-27B 微调,11 项基准的 Overall 为 85.71%,Jev 为 84.51%,Qwen3.8-27B 为 74.76%;但 WinoGrande 83.30%、BBH 82.80%、JevBench public hard 70.30% 低于 Jev。权重约 49 GiB,需 Python 3.12+ 与 CUDA GPU。可用 Decider.from_pretrained 加载,predict 支持选项选择、是/否概率和图片输入。

原文:pplx-decider-v1-27b is a decision model fine-tuned from Qwen3.8-27B.

  • • 工程师视角:可下载权重自托管做请求路由/决策与是/否判定,注意约 49 GiB 显存要求和部分基准不如 Jev。

13. SGLang v0.5.21 发布:779 个 PR 与新模型

代码 · sgl-project/sglang · 10-03

SGLang v0.5.21 发布:779 个 PR 与新模型

图源:sgl-project/sglang

SGLang v0.5.21 发布,含 779 个 PR、227 位贡献者。新增 DeepSeek-V4.1 Flash、GigaChat 3.5、IQuest-Q1 等 LLM/VLM 及多个 Diffusion 模型。PD 实例可在 prefill 与 decode 间在线切换、无需重启;DeepSeek-V4.1 长提示首 token 快 22%,Kimi K3 在 PD 服务下 prefill 吞吐提升 20.6%。

原文:779 PRs from 227 contributors.

  • • 工程师视角:可以用:升级命令为 uv pip install --prerelease=allow sglang==0.5.21(属于 prerelease),NVIDIA CUDA 13、AMD MI35x/MI30x、Intel GPU 与 CPU 均有对应 Docker 镜像;注意 prefix cache 默认已改为跑在 Rust 核心上,PD 在线切换角色属运行时行为变化。

14. 微软 FrogNano-4B:4B agent 模型已出 GGUF 量化

社区 · Reddit r/LocalLLaMA · 10-03

微软 FrogNano-4B:4B agent 模型已出 GGUF 量化

图源:Reddit r/LocalLLaMA

FrogNano-4B 是微软面向低显存设备的 agentic 模型,已有 GGUF 量化,基于 Qwen3.5-4B。额外后训练是纯文本、聚焦仓库级软件工程:用 RL 在约 1,500 个合成 SWE 任务环境上训练,奖励来自 Leaf harness 的可执行测试,不用更强模型的轨迹蒸馏。限制是对 harness 与测试质量敏感,数据偏 Python、以英文为主,生成的 patch 可能错误或不安全。

原文:FrogNano is derived from Qwen/Qwen3.5-4B, a general-purpose post-trained model designed for language, reasoning, coding, agentic, and multimodal tasks.

  • • 工程师视角:可以用:bartowski 的 GGUF 量化便于在低显存设备上跑仓库级编码 agent,但效果依赖 Leaf harness 与测试质量,生成的 patch 需人工审查、回归测试与安全校验后才能用。

15. Datalab 开源 OmniExtractBench 文档抽取基准

代码 · MarkTechPost · 10-02

Datalab 开源 OmniExtractBench 文档抽取基准

图源:MarkTechPost

Datalab 开源结构化文档抽取基准 OmniExtractBench:每道题给系统一个 PDF 和 JSON schema,系统输出 JSON,再逐值对照 gold 打分。它汇总 4 个已有基准的 620 份文档,同一个确定性 scorer 给每个值 6 种可审计判定之一,表格按内容用匈牙利算法配对。scorer 在 PyPI 发布为 omni-extract-bench(v0.1.7,Python 3.11+,仅依赖 SciPy),Apache 2.0;数据在 Hugging Face,CC BY 4.0。重跑厂商需自备 API key 与付费额度。

原文:The benchmark pools 620 documents from 4 existing benchmarks.

  • • 工程师视角:可以直接 uv pip install omni-extract-bench 给自己的抽取管线打分并拿到逐值判定说明,适合做 schema 抽取的内部对比;但重跑各家厂商模型要自备 API key 和付费额度,且数据许可为 CC BY 4.0,使用时注意署名。

快讯

  • • OpenAI发布GPT-6指南:指南介绍初创企业如何选择 GPT-6 模型、调推理强度、改进提示与技能、协调工具并为生产准备流程。(OpenAI 官方博客)
  • • Jev被约25%财富500强使用:TypeSafe CEO称Jev已被约25%财富500强使用,一周前日处理达一万亿tokens。(wsj.com)
  • • HF开源企业agent数据方案:Hugging Face 开源面向企业的 agent 训练数据方案。(Hugging Face 博客)
  • • Stability AI转向音乐:Sean Parker 将 Stability AI 转向音乐,并获唱片公司支持与资金。(TechCrunch AI)
  • • 美陆军成立自主系统司令部:美国陆军正成立自主系统司令部,防长此前宣布 Meridian 与 Agincourt 机器人战项目。(axios.com)
  • • 研究称AI会计任务超持证会计师:Mercor 研究称,当前 AI 模型在结构化会计任务的速度和准确率上超过持证 CPA。(The Decoder)
  • • 美逮捕Nvidia芯片走私嫌疑人:美国逮捕另一名嫌疑人,其被控向中国走私含出口管制 Nvidia 芯片的高端服务器。(Ars Technica AI)
  • • AI2开源AstaBrief:AI2 开源报告生成模型 AstaBrief。(Hugging Face 博客)
  • • 社区开源决策模型家族Kev:Kev 是四个开源决策模型家族,参数 0.8B 到 27B,与 Jev 同 API。(jaredpalmer.com)
  • • NVIDIA发布PixelUMM:NVIDIA 发布 PixelUMM 图像理解模型,用于 image-to-text。(Hugging Face · nvidia)

图片版权归原作者,出处见图注。

关注Hollis的多模态视觉大模型实战:每天一份 AI 早报,只看一手来源;能跑的,我先跑一下。

相关学习资料