乐于分享
好东西不私藏

至少两家AI平台已免费接入WorkBuddy

至少两家AI平台已免费接入WorkBuddy

对于经常使用AI工具的朋友来说,如今最头疼的莫过于高昂的API调用费用了。但现在终于等来了好消息——Agnes AI商汤日日新这两家顶尖AI平台,都已免费向WorkBuddy开发者开放,让你再也不用为钱包发愁!hy3免费总会过去,两个免费平台实际验证还是不错的。

      8月31日,腾讯hy3免费测试要结束了。


一、Agnes AI:全球首家全模态免费API,文生图生视频免费

它有多强?

Agnes AI是一,实力不容小觑-3。自2026年6月1日起,它宣布旗下三大核心模型API无限期免费开放,这也是全球第一家同时把文本、图片、视频三大模态API全部免费的AI Lab-3

Agnes开放的三款核心模型分别是:

  • 文本模型 Agnes-2.0-Flash:支持1M超长上下文窗口,在Claw-Eval真实Agent场景评测中名列前茅,覆盖代码开发、企业知识库、智能客服等专业场景-7

  • 图像模型 Agnes-Image-2.0-Flash:支持4K高清输出,覆盖图片生成、编辑和视觉资产生产-

  • 视频模型 Agnes-Video-V2.0:高速生成同步音画、具备电影级质感的视频。

实测效果也很令人惊喜。文本模型能够一键生成完整的飞机大战网页游戏,连Boss战、计分、粒子爆炸和动态星空背景都能自动带上-7。图像和视频模型同样表现出色,可以为用户快速生成专业级视觉内容。

接入WorkBuddy,只需3步

Agnes AI的API接入WorkBuddy极其简单,全程无需绑卡、不限量,三分钟就能搞定:

  1. 获取免费API Key:访问Agnes官网平台(https://platform.agnes-ai.com/)加速镜像 https://platform.agnes-ai.cn 注册登录后,进入API管理平台创建新的API密钥,完全免费,无需绑卡-3

  2. 接入文本模型:在WorkBuddy输入框左下角的模型选择器中,选择「+ 配置自定义模型」,提供商选「自定义 / Custom」,接口地址填 https://apihub.agnes-ai.com/v1,粘贴API Key,模型名称填 agnes-2.0-flash,保存即可-3

  3. 图像和视频模型打包成Skill:在WorkBuddy中直接发消息:“我想要使用agnes image 2.0模型生图,访问它的api平台https://agnes-ai.com/doc/overview,并将它打包成一份skill”,WorkBuddy会自动创建好Skill。视频模型同理,把模型名换成 agnes video v2.0 就行-3

创建完两个Skills后,技能栏里就能看到图片生成和视频生成的能力了。

免费背后的逻辑

Agnes AI创始人Bruce Yang表示,高质量AI不应该只属于高预算公司,让有限的预算更多用于产品创新和功能迭代,才是真正的目标-7。通过多模型集群加智能路由,Agnes把推理成本做到了单模型架构的1/10,这也是它敢于免费开放的核心底气-3


二、商汤日日新:轻量化多模态,每5小时1500次免费调用

技术亮点

商汤科技于2026年5月8日发布了新一代轻量化多模态智能体模型——SenseNova 6.7 Flash-Lite,并同步推出了SenseNova Token Plan限时免费活动-13

SenseNova 6.7 Flash-Lite采用了原生多模态架构,打破了传统“语言+视觉”拼接模式,可以直接理解网页布局、文档结构与财务图表,

同时,商汤将核心办公能力封装为SenseNova-Skills插件集,覆盖数据分析、报告撰写、PPT创作等高频场景Plan福利:每5小时1500次免费调用

开发者注册后首月可享受每5小时1500次调用额度的无门槛使用,支持SenseNova 6.7 Flash-Lite和SenseNova U1 Fast等核心模型-14。这些能力可以轻松完成数据分析、深度调研、PPT生成、信息图制作等复杂办公任务-13

接入WorkBuddy指南

商汤日日新的API同样可以快速接入WorkBuddy:

访问商汤日日新平台官网(https://www.sensenova.cn/)注册账号,获取免费API Key和Base URL-

在WorkBuddy的设置中,选择“自定义模型”,按照OpenAI兼容的API格式填写接口地址和Key,即可完成配置,全程零成本解锁极速AI体验-

  1. 完成接入后,可直接在WorkBuddy中调用SenseNova系列模型,享受每5小时1500次的免费调用额度,轻松跑通复杂任务。


三、总结:两大平台免费API对比

特性
Agnes AI
商汤日日新
免费内容
文本+图片+视频全模态API
每5小时1500次调用
费用
无限期免费
首月免费,后续推出多档套餐
最大优势
全模态、不限量、无需绑卡
轻量化、Token消耗低60%
办公场景
通用创作+开发测试
PPT/数据分析/深度调研
接入难度
3步搞定,Skill自动打包
自定义模型配置

如果你想体验全模态、不限量的免费API,Agnes AI是最省心的选择;如果你更关注企业级办公任务场景、追求Token消耗最优解,商汤日日新的轻量化模型会让你惊喜。两个平台的API都已无缝集成WorkBuddy,快去试试吧!

 三、本地核心工具选择(服务端)

无论您的显卡是多少显存,最推荐使用的服务端引擎只有两个:

  1. Ollama (首选):操作极其简单,ollama run 一条命令搞定。自带兼容 OpenAI 的 API (http://localhost:11434/v1),非常适合个人和小规模部署。

  2. llama.cpp 的 server 模块 (您目前正在用的):性能极致,占用资源少,支持复杂的并发设置。适合对性能有极致要求、需要多卡部署或自定义 Prompt 模板的用户。


分档推荐方案(显存 4G / 8G / 16G)

1. 显卡 4GB 显存(入门级,如 GTX 1650, RTX 3050 4G)

  • 硬件极限:4GB 显存非常吃紧,甚至放不下 7B 模型的权重。必须要开启部分卸载到内存(CPU+GPU 混合推理),推理速度有限,但能跑。

  • 推荐模型

    • Qwen2.5-1.5B-Instruct (1.5B 参数量)

    • Phi-3.5-mini (3.8B 参数量)

    • Gemma-2-2B (2B 参数量)

  • 推荐量化版本:必须是 Q4_K_M 或 IQ4_XS 级别的极高压缩量化。

  • 配置方案(以 Ollama 为例)

    • 启动命令:ollama run qwen2.5:1.5b

    • 对外收费配置:监听 0.0.0.0:11434,前端配置 Base URL 为 http://你的公网IP:11434/v1。注意,这类小模型适合处理简单问答、文本润色、翻译等轻量级任务,不适合深度推理。

2. 显卡 8GB 显存(主流甜点级,如 RTX 3060 12G/8G, RTX 4060 8G)

  • 硬件极限:这是目前性价比最高的配置。刚好能把 7B/8B 模型(Q4 量化)完全放入显存,推理速度快,响应几乎是秒出。

  • 推荐模型

    • Qwen2.5-7B-Instruct (通用能力极强,中文完美)

    • Llama-3.1-8B-Instruct (英文强,逻辑好)

    • Mistral-7B-Instruct-v0.3

  • 推荐量化版本Q4_K_M 或 Q5_K_M (如果您显存恰好有 8G,Q5 会比 Q4 稍微聪明一点,且显存勉强够用)。

  • 配置方案

    • Ollama:直接使用 ollama run qwen2.5:7b

    • llama.cpp (配合您之前的启动文件)

      bash

      ./llama-server -m Qwen2.5-7B-Q4_K_M.gguf -c8192--host0.0.0.0 --port8080-ngl99

      (注:-ngl 99 代表把模型全部丢进显卡,如果爆显存了,根据您的 8G 显存,酌情改为 -ngl 20 或 -ngl 30 把一部分留在内存)

    • 收费建议:用这个配置做对话机器人(如角色扮演、客服)体验极佳,成本非常低。

3. 显卡 16GB 显存(中高端,如 RTX 4080, RTX 4090, 或两块 3060 12G)

  • 硬件极限:这是目前的黄金配置。可以无压力运行 14B 到 34B 参数的大模型。

  • 推荐模型

    • Qwen2.5-14B-Instruct (国内最强 14B,逻辑清晰,代码能力强)

    • DeepSeek-V3-Lite / DeepSeek-R1-Distill-Qwen-14B (推理链极强,适合写代码和数学题)

    • Yi-1.5-34B-Chat (如果您的 16G 显存支持 Q4 量化能放下)

  • 推荐量化版本:对于 14B 模型,推荐 Q4_K_M;对于 34B 模型,推荐 Q3_K_S 或 IQ3_XS

  • 配置方案

    • API 并发:16G 显存可以开启 2-4 个并发槽位(--parallel 4)。这在对外收费时非常重要,可以同时处理多个用户的请求。建议使用 llama.cpp,因为它对并发管理做得比 Ollama 更好。

    • 收费定位:这个配置的模型智商已经和 GPT-3.5 非常接近,适合对外提供高质量的翻译、长文档总结、代码辅助服务。


本地模型一旦跑起来,可以它变成能赚钱的 API,开启“按 Token 收费”的接入!