乐于分享
好东西不私藏

AI 周报 · 2026年8月18日-24日

AI 周报 · 2026年8月18日-24日

AI 周报 · 2026年8月18日-24日

本期关键词:DeepSeek 多模态、Gemini 3.7 Flash、Claude 工具 GA、Grok 4.6 企业版、API 定价变革

本周 AI 领域重磅消息密集:DeepSeek 上线首个多模态视觉模型并完成峰谷定价调整,谷歌推出 Gemini 3.7 Flash 并同步进入 GitHub Copilot,Anthropic 将 Computer Use、Browser Use 和 Skills API 正式转正,xAI Grok 4.6 登陆 Google 企业平台。以下是详细解读与实战指南。

本周重要新闻

一、DeepSeek-V4-Flash-Vision-Exp 多模态模型发布

8月21日,DeepSeek 上线全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp。这是 DeepSeek 首次支持图片输入的模型,用户通过设置 model='deepseek-v4-flash-vision-exp' 即可访问。

该模型在 V4-Flash 纯文本能力(Agent、推理、世界知识)基础上,新增图片理解能力。多模态 Agent 基准测试较 V4-Flash 大幅提升,性能接近 Claude Opus 4.8。支持三种图片传入方式:外部 URL、Base64 编码、以及同步发布的免费 Files API。同时兼容 OpenAI Chat Completions、Anthropic Messages 和 OpenAI Responses 三种 API 格式,定价与 V4-Flash 一致。

同日,DeepSeek Harness 0.1.1 发布,开箱即用支持新模型。

二、DeepSeek API 峰谷定价调整与周末优化

8月17日,DeepSeek 宣布全面调整 API 价格,引入峰谷定价机制。高峰时段(北京时间9:00-12:00、14:00-18:00)价格为低谷时段的两倍,其中 V4-Pro 高峰时段涨幅最高达 1100%

8月23日,DeepSeek 进一步优化规则:周末(周六及周日)全天不再区分峰谷时段,统一按低谷价格计费。当前定价为:V4-Flash 空闲时段 4.5元/百万tokens输出,高峰时段 9.0元;V4-Pro 空闲 13.5元,高峰 27.0元。

同期,国内大模型行业迎来集体调价:阿里云、腾讯云、百度智能云、智谱AI 等头部厂商先后上调 API 价格,腾讯云年内两次涨价,智谱AI 完成三次调价。摩根士丹利研报认为,中国大模型正从价格战转向商业化提速阶段。

三、Google Gemini 3.7 Flash 发布,同步上线 GitHub Copilot

8月13日,谷歌推出 Gemini 3.7 Flash,距上一代 3.6 Flash 仅三周。谷歌将其定义为"迄今为止用于编码和智能体领域最智能的 Flash 级主力模型"。

该模型在软件工程基准测试中达到 65.3%,在调试和问题修复方面较 3.6 Flash 有显著提升。支持 100 万 token 上下文窗口,可处理文本、图像、音频和视频输入。同日上线 GitHub Copilot,覆盖 VS Code、Visual Studio、JetBrains、Xcode、Eclipse 等主流 IDE,支持 Copilot Pro/Pro+/Max/Business/Enterprise 全部套餐。

四、Claude Computer Use、Browser Use、Skills API 正式可用

8月20日,Anthropic 将 Computer Use、Browser Use、Skills API 和 Files API 从 Beta 转为正式可用(GA)。

Computer Use 新增批量多动作操作,不再需要 beta header;Browser Use 通过读取页面无障碍树(accessibility tree)按引用点击元素,取代了之前猜测屏幕坐标的方式,大幅提升了操作精度;Skills API 和 Files API 去除 beta 标签,Files API 新增自动过期功能。

五、xAI Grok 4.6 登陆 Google 企业智能体平台

8月21日,xAI 将 Grok 4.6 接入 Google Enterprise Agent Platform 的 Model Garden。Grok 4.6 提供 50 万 token 上下文窗口和四级推理强度(low/medium/high/xhigh),专为长程智能体和交互式视觉任务设计。

定价为输入 $2/百万tokens、缓存输入 $0.50/百万tokens、输出 $6/百万tokens。目前标记为 Preview 状态,企业用户可通过现有 Google Cloud 合约使用。

六、OpenAI Workflow Builder 支持多模型编排

OpenAI 8月发布 Workflow Builder 更新,开发者可在单一工作流中链式调用 GPT-5、DALL-E 4 和 CodeX,通过拖拽界面完成多模型编排。同时推出 Prompt Engineering Toolkit 2.0,集成动态提示模板、上下文感知调试和提示词版本控制。

此外,OpenAI Enterprise Workflow Suite 支持"模型无关"架构,允许接入 Anthropic Claude、Google Gemini 等第三方模型,并提供内置可观测性和审计追踪。

实战技能

技能一:DeepSeek-V4-Flash-Vision 多模态 API 实战

DeepSeek 多模态模型支持三种图片传入方式,以下是基于 OpenAI SDK 的完整调用示例:

from openai import OpenAI

client = OpenAI(
    api_key="<DeepSeek API Key>",
    base_url="https://api.deepseek.com"
)

# 方式1:外部 URL(适合快速测试)
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
            {"type": "text", "text": "分析这张图表的趋势,并给出结论"}
        ]
    }]
)

# 方式2:Base64 编码(适合本地文件)
import base64
with open("image.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
            {"type": "text", "text": "识别图中的文字内容"}
        ]
    }]
)

# 方式3:Files API(适合大文件,免费)
file_resp = client.files.create(file=open("large.png", "rb"), purpose="vision")
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "file", "file_id": file_resp.id},
            {"type": "text", "text": "描述这张图片的内容"}
        ]
    }]
)

print(response.choices[0].message.content)

提示:模型支持 JPG、PNG、GIF、WebP 四种格式,单张图片最大 10MB。Base64 方式受 48MiB 请求体限制,大文件建议用 Files API。同时兼容 Anthropic 格式(base_url 改为 https://api.deepseek.com/anthropic)。

技能二:GitHub Copilot 中启用 Gemini 3.7 Flash

Gemini 3.7 Flash 已上线 GitHub Copilot,但 Business 和 Enterprise 版需要管理员手动启用:

# 启用步骤(管理员操作):
# 1. 进入 GitHub 组织设置 → Copilot → Policies
# 2. 找到 "Gemini 3.7 Flash Preview" 策略
# 3. 点击 Enable 保存

# 开发者使用(支持所有主流 IDE):
# VS Code / Visual Studio / JetBrains / Xcode / Eclipse
# Copilot CLI / Copilot Cloud Agent / Copilot App

# 在编辑器中切换模型:
# 打开 Copilot 聊天面板 → 点击模型选择器 → 选择 Gemini 3.7 Flash

个人版(Pro/Pro+/Max)用户无需管理员操作,直接在模型选择器中切换即可。按提供商定价计费,适合需要长上下文和复杂调试的场景。

技能三:DeepSeek 峰谷定价下的 API 成本优化策略

峰谷定价实施后,合理调度 API 调用时段可节省近 50% 成本:

# DeepSeek 峰谷时段(北京时间)
# 高峰:09:00-12:00, 14:00-18:00(工作日)
# 低谷:其余时段 + 周末全天

# 成本优化策略:
# 1. 批量推理任务安排在低谷时段(如夜间)
# 2. 实时对话用 V4-Flash,复杂推理用 V4-Pro
# 3. 周末全天低谷价,适合跑大规模评测
# 4. 利用缓存命中降低输入成本

# Python 示例:延时任务调度
import datetime

def is_peak_hour():
    now = datetime.datetime.now()
    if now.weekday() >= 5:  # 周末全天低谷
        return False
    hour = now.hour
    if 9 <= hour < 12 or 14 <= hour < 18:
        return True
    return False

# V4-Flash: 高峰 9.0元 vs 低谷 4.5元/百万tokens
# V4-Pro:   高峰 27.0元 vs 低谷 13.5元/百万tokens
# 周末/夜间批量任务可节省 50% 成本

实战建议:将非实时的批量处理、数据清洗、模型评测等任务调度到低谷时段或周末执行,实时交互场景使用缓存命中(缓存命中输入价格仅为正常价格的 1/10),可显著降低 API 费用。

来源

DeepSeek API Docs (api-docs.deepseek.com) · 蓝鲸新闻 (thepaper.cn) · 每日经济新闻 (toutiao.com) · AIBase (aibase.com) · Google DeepMind (deepmind.google) · 9to5Google (9to5google.com) · 36氪 (36kr.com) · GitHub Blog (github.blog) · Claude Platform (platform.claude.com) · AI Tools Review (aitoolsreview.co.uk) · Releasebot (releasebot.io) · AI TLDR (ai-tldr.dev) · TechDailyShot (techdailyshot.com) · MorningMail AI (morningmail.ai)