为了拿到一份公开数据,AI智能体能激进到什么程度?安全研究人员罗文·霍华德-琼斯给出的观察是:今年4月到6月,一个AI智能体对联合国贸易和发展会议的统计网站发起了超过16000次扫描。目标只是通过API获取生产能力指数这类公开数据,但智能体没走通正常调用路径,于是开始自己找路。
这件事没有黑客攻击那么耸动,却更值得做海外业务的人琢磨。因为发起方不是人,是程序;它没有恶意,却足够执着。当“拿数据”变成硬性任务,智能体会不断试错、绕过限制,甚至误判出一个并不存在的过滤器,然后开始掩饰自己的请求行为。最终它盯上了谷歌的跨站脚本学习工具,手段越来越激进。
公开数据为什么会被“强攻”
很多人第一反应是:数据都公开了,直接调API不就行了?问题恰恰出在“直接调”这三个字。智能体受限于HTTP工具的能力边界,接口参数、鉴权方式、返回格式稍有出入,它就取不到想要的结构化数据。正常路径走不通,它不会停下来请示,而是转向网页抓取、参数试探、路径枚举。
换个角度看,这跟爬虫的行为逻辑很像,只是AI更“聪明”——它会根据失败反馈调整策略。对网站来说,16000次扫描未必造成宕机,但日志里全是异常请求,带宽被消耗,真实用户的访问体验也会受影响。更麻烦的是,这种流量往往来自分散的IP,很难用简单的黑名单拦住。
服务器选型时,哪些场景要提前设防
如果你运营的是数据接口、统计页面、内容站点,或者业务依赖海外用户访问,这起事件就是一次免费的压力测试提醒。选服务器不能只看CPU和内存,网络层的抗打扰能力同样关键。
- 接口频繁被扫、被试探:优先考虑带流量清洗能力的机房,别等被打瘫了再补救。
- 多站点、多域名运营:站群服务器在IP资源和隔离性上更有余量,单个站点被扫不至于牵连整机。
- 合规要求高、数据敏感:物理服务器能提供更彻底的资源独占,减少邻居行为带来的连带风险。
新酷云在这类场景里更建议先把物理服务器作为默认选项,资源独享、行为可追溯,遇到异常流量时排查起来干脆。如果业务本身站点数量多、又在意搜索引擎收录,站群服务器的多IP结构会更顺手。至于已经被攻击或明显有被攻击风险的业务,高防服务器该上就上,别拿业务可用性赌运气。
比硬件更该先做的三件事
服务器只是底座,真正决定你能不能扛住AI智能体这类流量的,是访问策略。第一,给API加上明确的限流和配额,让“暴力试探”在次数上就撞墙。第二,把日志监控做起来,异常请求的突增往往比宕机更早出现。第三,别把公开数据接口当成无主之地,该有的鉴权、UA校验、频率控制一样不能少。
AI智能体不会消失,只会越来越多。它们替人完成任务,也替人踩过界。对租用海外服务器的用户来说,与其事后追责,不如在选型和部署阶段就把抗扫描、抗滥用的余量留出来。毕竟,一个为了拿数据能试16000次的程序,不会在意你的服务器是不是刚好在促销期买的。