00:00
哈喽,大家好,我是于小夏,本期视频给大家带来的是量数据。搜索引擎API的6种响应格式那么很多人他第一次接触搜索引擎API的时候,可能以为他只能返回一个网页的HTML。但是实际上的话呢,它还揭持了其示支持了很多种的格式,比如说food Jason food Jason, 然后like Jason啊,Markdown, 还有网页截图,还有结构化的一个bin的搜索结果啊,今天的话呢,我会本期视频用一个统一的关键词,然后依次分别去运行这6种。格式。那么每次的话,我只会改变他们的一个响应格式,然后看看他们返回的话是一个什么样的不同结果,看看他们之间会有一个怎样的一个区别,那么在不同的业务场景下,我们该如何去对它进行一个选择?在页面的这个表格上,我已经列出来了,他们的话六种格式的一个区别,可以看到HTML的话,它是一个原始网页代码,然后来杰son的话,它是一个轻量的结构化的一个数据,然后杰森的话,它是一个完整搜索页面的一个数据,然后马down的话呢,它是一个AR和arg一个可读的文本。
01:07
然后screen shot的话,它是一个搜索页面的一个截图。那么pass的病,然后的话,这个是一个并结构化的一个搜索的结果。我们来到一个量数据的这个一个页面,这个是我已经登录上来了,我已经创建了一个。在这个网络API这边的话,我是已经创建好了的。那么可以看到这是我写的一个区域的名称,我们接下来6次测试的话,都会使用这同一个区域,然后我会使用同一个我们的API密钥。然后还有同一个关键词,呃,这里的话,我们的这个API密钥相当于就是一个账户的凭证,属于门槛信息,所以我这边的话是会给大家显示。在这个文件夹中。
02:00
后续我们的不同的格式的话,都会在这里出现。好,我们打开这个CMD。我们第一种测试的话是一个HTML的,然后这个的话是不进行结构化的解析,它是直接返回搜索页面的一个原始网页内容。然后我们将提前准备好的一个。指令,那我们就来进行运行。哦,可以看到这边的话是已经成功生成了。好,我们打开这个文件夹。我们是可以看到,按照我们的要求,这个格格式HTML的话已经是出来了,我们可以用Vs code的给它打开。看一下是什么样子的。啊,我们可以看到。在这个文件当中,结果包含了大量的一个HTML的标签。
03:01
它的一个网页结构,还有一个网页内容,那么这个让HTML的它的优势是什么呢?它就是保留这个信息比较完整,开发者的话可以根据自己的业务需求,然后编写解析的规则。但这个灵活度非常的高,但是它的缺点也是非常明显,我们可以看到。在这个页面当中,这些数据的内容密密麻麻的,然后它的内容的话呢,是不够直观的。所以说它不能直接用于数据分析。通常的话,他还需要继续来进行清洗,然后还有通过提取字段。那么第二个格式的话,我们测试的是like Jason.那么搜索关键词的话是不变的,然后支持的话是增加的它这个。一个格式,然后让接口直接返回一个轻量化的一个结构数据。好,我们先清一个屏。
04:00
然后还是我们提前准备好的一个指令。啊,这边的话是已经生成了Jason。好,我们可以在这里看到,同样的话,我们还是通过Vs code来进行打开。那么当前的话,内容的话,相比于刚才比较原始的HTML,它这次的数据的话会比较清晰一点。啊,这里的话可以看到organic,也就是有机搜索的一个结果,那么每条结果的话呢,它都是。包含了一个排名,然后title的一个标签,还有link的一个链接。和一个摘要,那杰森的话呢,它主要保留的就是前10条有机结果,所以它不会包含大量不必要的网络结构,如果业务的话,它只做SEQ的话排名监控。关键词的一个追踪或者快速获取核心搜索结果的话,那么莱德杰省的话,它的数据量会更小,后续处理的话也会更加的方便。
05:10
接下来我们要测试的话是弗杰森,他与莱德杰森相比的话呢。会更加会返回到是一个更加完整的一个搜索页面结构,适合一个深入分析。好,我们现在完成了。我们可以看到,除了普通的有机搜索结果外的话,它可能还包含了一个顶部的。这个广告啊,还有底部的,或者说竞选的一个摘要知识面板。相关问题结的结果和新闻内容都在这里面。具体返回哪个模块,取决于那个关键词访问地区,还有搜索页面实际展示的一些内容。
06:06
那如果需要做一些竞品广告研究,品牌搜索表现分析,或者完整的搜索页面分析的话,那么会节省的话,它会更为合适,相应的它返回的数据量也会更加的多。我们可以看到。啊,很多啊。文件体积的话和后续处理量的话,通常的话也是会比较大的。下面我们要设置的是一个markdown设置的接口会去掉一些复杂的网页标签,它会把搜索页面转化成更加适合阅读和文本处理的一个格式。所以说它会内容会比较干净。
07:02
我们可以看到。马来档格式已经出出现在我们的文件夹中了。然后我们双击打开它。那我们可以看到当中的结果的话,已经没有刚才那么多复杂的。H天的一个。标签内容的话也是更加接近我们。正常阅读的一个文本标题的话,还有链接。还有摘要仍然都被保留了下来,但是截整体的这个结构的话呢,会更加的清晰。如果我搜索后的这个内容后续需要交给AI agent大模型,然后进行摘要,或者说进入arg的知识库马克down的话,通翅会比原始的这个HTML会更加的方便,因为它可以减少前期的清洗网页标签的一个工作。更适合直接进入一个文本处理流程。
08:05
那么第5种我们测试的话呢,Screen shot, 它的话返回的不是HTML。或者杰森他,而是他返回的是一张搜索结果的一个页面实际截图,然后我们来看看会是什么样。好,那么已经是完成了,我们来看一下。
09:13
可以看到这里的话呢,搜索的就是我们本次所使用的一个关键词啊,这里生成的是一是一张PNG的一个图片,可以直观的看到搜索页面当前的实际展示效果。那么screen shot的话,不像jas那样可以直接查询那个字段,但它很适合一个广告位置的一个记录,然后品牌搜索页面的监控,UI验证和历史页面的一个存档。当业务需要他保证视觉。证据。啊,不仅仅是保存文本文,保存文字和链接的时候。那么他会更加的直观。好,我们给它擦掉。那么接下来就是我们的最后一种格式,就是pass。它的话呢,它它的话不会改变我们的一个搜索关键词,仍然还是我们原先的,但是的话,搜索引擎的话呢,会从一个Google,然后变成的话变成B,它返回的是与BAPI相似的一个结构化处理结果。
10:21
我们打开看看。这里可以。看到。Web pages的话,然后还有value,每一条结构中的话呢,都是包含了。内部的标题,然后URL的链接。还有display又要展示地址以及一个摘要,这篇文的话我们都是可以都是可以看到的。如果你的业务的话呢,需要分析一个bin的排名,或者比较Google和bin之间的一个搜索结果差异,就可以使用pass bin, 然后的话,这样可以保持相对统一的数据获取流程,不需要完全重新设计返回那个数据结构。
11:08
然后本次的话呢,我们已经是把6种格式的话呢,都已经演示了一遍。接下来我们把6种格式的话呢,分在一起看一下。如果只关心前十有机结果,或者说是s seq排名的话,那么我说我们可以是果断的选择like。如果需要广告知识面板,或者说相关的问题,以及更加完整的一个搜索模块,那么的话我们是可以选择杰森的。当数据需要进入AI agent, 还有IG知识库或者大模型文本处理流程的时候,这个时候的话呢,我们就可以选择markdown格式了。如果需要保存搜索页面和一个实际视觉效果啊,这里我们就可以选择。
12:02
Shot.如果团队他希望自己编写一个简洁的规则,并且保留了大量的灵灵活性的话。这里的话是我们就是直接选择run HTML的话就是可以了的。如果需要研究病的排名,或者说在不同引擎搜索引擎之间的一个差异啊,那么可以直接使用发生的病。那么量数据,它这个收到一些API的话,优势在于同一个接口,它就能够根据不同的业务。需求,然后返回多种形式的一个数据,那么团队的话呢,它就不需要去分别维护网页访问,然后HTP的解析,还有结构化输出和页面截图等等等啊多套工具。它量数据的话,它是能够减少重复开发和后期维护的一个工作,实际使用的时候呢,也就没必要盲目的选择字段最多的格式,我们的话呢,只需要按照我们的需求,然后选择刚好满足业务需求的格式,这样的话更容易控制相应的速度,然后数据处理量和整体的一个成本。
13:06
那么本期视频的话呢,就是以上这些,如果想体验量数据这个API的朋友,可以通过视频下方的一个专属注册链接,然后有免费的试用额额度哦。谢谢大家。
我来说两句