ARTICLE · 1074302
AI开始交出可复核的成果:病毒结构库与安全Agent
Juju Radar · 2026 年 9 月 25 日
本期导读
今天没有必须追着看的新大模型。更值得花时间的,是几件已经拿出数据、代码或实验结果的事:一个收进数千个病毒蛋白组合的开放结构库,一套会根据覆盖率调整测试方向的安全Agent,以及vLLM对生成文本水印的工程实现。
最后补看一篇教育研究。它让两千多名真人学习者接受一小时GRE辅导,再用独立后测比较AI和人类导师。论文提交时间比本期检索窗口早了约五小时,故明确列作“近期补看”。
🧬 2800多种病毒的蛋白组合,现在可以直接查结构
AI for Science / 生物医药 · 9.0/10 · 建议深挖
由EMBL-EBI和Google DeepMind维护的AlphaFold数据库,新增了面向疫情防备的病毒结构入口。数据库当前显示,这批新预测覆盖2,812个病毒蛋白组,包含5,279个高置信异源二聚体、2,749个高置信同源二聚体。二聚体可以理解为两段蛋白结合后的形状;其中“异源”指不同蛋白相遇,“同源”指同一种蛋白两份结合。另有4,681个来自既有Viral AlphaFold Database的同源二聚体,不能都算成这次团队新算出的结果。
真正值得注意的,不是“AI又算了很多结构”,而是科研人员已经可以在数据库里浏览这些候选,并拿到NVIDIA公开的BioNeMo结构预测流水线,按自己的序列重复批量计算。过去要研究一个病毒蛋白可能和谁结合,往往先要逐个筛选假设;现在可以先看结构候选,把昂贵实验放在更有希望的位置。NVIDIA称约30%的相互作用在存放实验结构的PDB里没有现成对应记录,说明有不少值得追查的空白。
这里的“高置信”仍是计算预测,不是显微镜或生化实验已经证实结合,更不是发现疫苗或药物。结构还要由实验验证,功能也要进一步测。我的判断是,这类工作比单个模型刷新蛋白预测榜单更实用:数据、入口和生成流程同时开放,别人能查、能挑、也能尝试推翻。
🛠️ GitHub让安全Agent盯住模糊测试的覆盖率
Coding Agent / 开源安全工具 · 8.7/10 · 建议动手验证
GitHub Security Lab开放了Fuzzing Taskflow,目标是让C/C++项目的模糊测试不再只靠安全工程师反复盯着。模糊测试会自动向程序喂大量变化的输入,观察是否崩溃;难点在于很多代码路径压根没被测到,必须有人写新的测试入口、分析未覆盖的分支、再调整输入。这个项目把这些琐碎却关键的决策连成一个Agent循环。
它不是让模型凭空“找漏洞”。Agent选择目标函数、编写测试程序,然后通过工具调用编译器和AFL++;同一测试程序会编译成模糊测试版与覆盖率版。前者持续变异输入,后者回放已跑出的样本,告诉Agent哪几行、哪些分支还没走到。Agent再决定补哪种输入或重写测试入口,覆盖率连续两轮几乎不增长才停下。运行状态和崩溃记录保存在本地数据库里,安全人员能回看每轮决策。
这解决的是测试维护中的人力瓶颈,尚不能当作“自动发现漏洞的可靠率已被证明”。作者自己也说,Agent对崩溃可达性和补丁正确性的判断可能错,报告只是人工审查的起点。它会运行仓库的构建命令,应放在一次性隔离环境。对维护底层库的人,这套可运行的流程值得试;先比较覆盖率和误报,再谈节省多少安全人力。
🔎 vLLM把可追溯水印做进推理采样器
推理基础设施 / AI内容溯源 · 8.3/10 · 建议持续观察
vLLM在9月24日详细解释了自己的Gumbel-max文本水印实现。先说时间:功能此前已随9月22日的v0.30.0进入开源推理框架,本次新的是机制与测试说明。它给采样过程加入与密钥相关的随机值;掌握密钥和分词器的一方,可以回算某段文本里的token选择是否呈现这个水印应有的统计偏好。文字表面没有肉眼可见的标记。
有意思的是,它试图让水印不改变模型原本的输出分布。这个保证需要说准:对密钥取平均时,单步选中某个token的概率保持不变;若上下文重复,固定密钥会让同一位置的随机偏好反复出现,整段文本仍可能更容易陷入循环。vLLM因此对重复上下文跳过加水印,也为推测解码设计了双密钥处理。它还把随机数生成和选词合成GPU内核,避免一个巨大的临时张量。
官方在单张H100上跑Qwen3.5-27B,报告不同批量下吞吐变化约为-1.1%至+2.0%。这是特定负载的性能测试,不能保证所有模型“零成本”。短回答、公式化代码和同时尝试多把密钥时,检测力会下降;水印最多提供统计证据,不能把未检出直接当作“人写的”。部署方还应检查服务器水印策略能否被单次请求覆盖。它值得关注的地方,是把内容溯源从论文想法推进到推理系统可配置的部件。
近期补看
📚 一小时GRE辅导实验:AI和人类导师效果接近
AI评测 / 教育研究 / 论文 · 8.5/10 · 建议读研究设计
StudentBench研究让2,383名成人分别接受AI辅导、人类辅导或不接受辅导,再比较GRE定量与语文题的学习增益。论文报告,在这项一小时的实验里,AI和专家人类导师带来的即时增益达到预设的统计等效标准。作者还记录了17.5万多条学生与AI之间的消息,并让专业导师做2,028次教学材料比较。
关键不是“AI像不像老师”,而是学生离开辅导后能不能独立答题。很多教学评测只让另一个模型给回答打分;这项研究至少把真人学习者的后测结果放在了中心。作者估算,其中一个AI导师每带来一个百分点的成绩提升,成本比人类导师低918倍。这个数字受实验中的导师价格和模型调用成本影响,不是所有学校的预算预测。
结论也有很清楚的边界:受试者是会英语的成年人,任务是GRE,测的是短时提升;没有数月后的保留测试,也没有单独的“自己做练习题”对照组。不能据此说AI老师在中小学、中文课堂或长期培养上全面等于真人。论文在北京时间9月24日01:57提交,早于本期窗口,所以放在补看,不冒充今日新发布。
今天的主线
今天几件事的共同点,是让AI的作用可以在模型回答之外检查。病毒结构库给出可下载、可实验核查的候选;安全Agent把每轮覆盖率和崩溃记录留在工作流里;vLLM水印需要明确的密钥和统计检验;StudentBench干脆看真实学习者的后测。进展的价值不只在“模型会做”,还在别人能不能据此复核、接着做,或者指出它哪里错了。
推荐阅读
做科研的读者先打开AlphaFold数据库,看看结构条目和原始数据;做Agent或安全工程的先看GitHub仓库里的测试循环与隔离要求。对内容溯源感兴趣,再读vLLM关于单步分布、重复上下文和短文本检测的说明。StudentBench最该读的是实验分组及局限,不是单拎“918倍便宜”做标题。
原始资料
点击文末“阅读原文”,查看本期全部数据库、代码、论文与技术说明。
• AlphaFold数据库:病毒结构专题入口 • NVIDIA:病毒蛋白复合物数据发布说明 • BioNeMo结构预测流水线代码 • GitHub Security Lab:Fuzzing Taskflow工程文章 • GitHub Security Lab:Fuzzing Taskflow仓库 • vLLM:Gumbel-max水印技术说明 • vLLM水印功能文档 • StudentBench预印本 • StudentBench代码与数据
本文由AI辅助检索与整理。重要度为编辑判断;涉及的预测结构、实验结论和性能数据均按原始材料及适用范围表述。