AI 电商关键词调研:竞品分析到长尾词挖掘的全自动 pipeline
引言
做电商的人都知道,关键词调研是上架、投放、SEO 的地基,但也是最磨人的环节。传统流程大致是这样:先凭经验定几个核心词,再去反查竞品 ASIN 或商品链接,下载几份表格,手动去重、翻译、筛选,最后靠人眼判断哪些词有量、哪些词是废词。一套下来,一个品类少则两三天,多则一周。而且结果严重依赖执行者的经验——同一个竞品,新手和老手挖出来的词能差出一倍。
更麻烦的是,关键词不是静态的。用户搜索习惯在变,竞品标题在改,平台算法在调。你上个月挖好的词库,这个月可能就衰减了。所以关键词调研不该是一次性任务,而应该是一条可持续运行的流水线。这篇文章就讲怎么用 AI 搭一条从竞品分析到长尾词挖掘的全自动 pipeline:输入一个品类,自动抓取 top 竞品商品,提炼标题模式,生成关键词矩阵,1 小时完成原来 3 天的工作。
第一步:自动抓取竞品商品,建立语料库
pipeline 的第一环是数据采集。你不需要自己写爬虫去绕反爬,现在主流电商平台基本都有开放 API 或成熟的第三方数据服务(比如卖家精灵、Helium 10 的 API),可以按品类关键词拉取 top 10-20 个竞品的标题、描述、五点、后台关键词。
以亚马逊 SP-API 为例,按品类词搜索后,把竞品 ASIN 的标题和描述汇总成一个语料文件:
import requests
def fetch_competitor_titles(keyword: str, asin_list: list) -> list:
"""拉取竞品标题与描述,返回结构化语料"""
corpus = []
for asin in asin_list:
# 调用 SP-API 的 get_listings_item 接口
resp = requests.get(
f"https://sellingpartnerapi-na.amazon.com/listings/2021-08-01/items/{asin}",
headers={"x-amz-access-token": get_token()}
)
item = resp.json()
corpus.append({
"asin": asin,
"title": item.get("title", ""),
"bullet_points": item.get("bullet_points", []),
})
return corpus
这一步的关键不是代码,而是语料质量。竞品选得准不准,直接决定后面挖出来的词有没有参考价值。建议按三个维度筛选竞品:销量排名靠前、Review 数量适中(500-5000 之间,说明有量但没到垄断)、标题里包含核心品类词。这样拿到的语料既有代表性,又有差异度。
第二步:用 LLM 提炼标题模式与核心词
有了语料,接下来是重头戏:让大模型从竞品标题里提炼结构。这一步要解决两个问题——竞品标题里哪些词是"流量词"(用户会搜的),哪些是"修饰词"(卖点描述,比如 "stainless steel"、"wireless")。
直接让模型"分析标题"往往得到一堆空话。更好的做法是给模型一个明确的输出 schema,强迫它做结构化提取:
from openai import OpenAI
client = OpenAI()
def extract_keyword_patterns(corpus: list) -> dict:
"""让 LLM 从竞品标题中提炼关键词模式"""
titles = "\n".join([f"- {c['title']}" for c in corpus])
prompt = f"""
以下是某品类 top 10 竞品的商品标题。请提炼:
1. 高频核心词(用户搜索意图最强的 20 个)
2. 属性修饰词(材质/尺寸/功能/场景等,各列 10 个)
3. 标题通用结构模板(用占位符表示,如 "[品牌] [核心词] for [场景] [属性1] [属性2]")
标题列表:
{titles}
输出 JSON 格式,key 分别为 core_keywords, attribute_keywords, title_template。
"""
resp = client.chat.completions.create(
model="gpt-4o",
response_format={"type": "json_object"},
messages=[{"role": "user", "content": prompt}]
)
return json.loads(resp.choices[0].message.content)
这一步的核心价值在于提炼标题模板。模板比单个词更有用——它告诉你竞品是怎么组织信息的,你照着这个结构填自己的词,标题的搜索权重不会差。比如挖出来的模板是 [核心词] for [场景] [属性],你就能批量生成 Wireless Earbuds for Running Waterproof 这类合规且高权重的标题。
第三步:长尾词挖掘与关键词矩阵生成
核心词是骨架,长尾词才是肉。长尾词的特点是搜索量小但转化率高、竞争低,是新品冷启动和 SEO 的主要流量来源。传统做法是靠工具联想,但工具给的长尾词往往泛而不精。AI 的做法是基于竞品语料 + 用户评论 + 平台联想词,三路并进。
def generate_long_tail(core_keywords: list, attribute_keywords: list) -> list:
"""基于核心词+属性词组合生成长尾词"""
long_tail = []
for core in core_keywords[:10]:
for attr in attribute_keywords[:10]:
long_tail.append(f"{core} {attr}")
long_tail.append(f"{attr} {core} for home") # 场景组合
return list(set(long_tail)) # 去重
光靠排列组合还不够,更高质量的长尾词来自用户评论。评论里藏着真实的使用场景和痛点,比如"battery life"、"easy to clean",这些是竞品标题里未必有、但用户真实会搜的词。把竞品的差评和高频好评喂给 LLM,让它提取"用户真实搜索词",往往能挖到工具给不了的词。
最后把这些词汇总成一张关键词矩阵,按"核心词 / 长尾词 / 场景词 / 痛点词"分列,并标注来源(竞品标题、评论、平台联想)和预估竞争度。这张表就是后续上架、投广告、写 listing 的弹药库。
| 词类型 | 示例 | 来源 | 用途 |
|---|---|---|---|
| 核心词 | wireless earbuds | 竞品标题高频 | 主标题、广告大词 |
| 属性词 | waterproof, noise-canceling | 竞品标题提炼 | 标题修饰、五点 |
| 场景词 | for running, for gym | 评论+联想 | 长尾标题、广告 |
| 痛点词 | long battery life | 差评提取 | 五点卖点、QA |
第四步:定时重跑,让词库保持新鲜
关键词是"易腐品"。今天有效的大词,三个月后可能被算法降权;用户搜索习惯也在漂移。所以 pipeline 的最后一步是定时任务——每天或每周自动重跑一遍抓取+提炼流程,把新词并入库,把衰减词标记出来。
这正好是智能决策引擎擅长的场景。ClawBrain 是专为龙虾(OpenClaw)打造的智能决策引擎,具备任务闭环、自主规划、错误自愈能力。你可以把上述脚本封装成一个定时任务交给它:每天自动抓取竞品、调用 LLM 提炼、更新关键词矩阵,中途遇到 API 限流或数据格式变化,它能自动重试、降级或告警,让龙虾真正能独立做事,而不是脚本一崩就躺平。
总结
从竞品抓取、标题模式提炼、长尾词挖掘到定时重跑,这条 pipeline 把关键词调研从"一次性人肉苦力"变成了"可持续运行的自动化流程"。核心收获有三点:一是语料质量决定上限,竞品选得准,挖出来的词才有价值;二是结构化输出比自由发挥有用,给 LLM 明确的 schema,它才能产出可直接落地的结果;三是词库要持续维护,定时重跑才能跟上搜索意图的变化。
这套方法不挑平台,亚马逊、Shopify、国内电商都能套用。区别只在于数据源和 API 的接入方式,核心的"抓取 → 提炼 → 组合 → 维护"逻辑是通用的。如果你正在为关键词调研发愁,不妨从今天开始,把第一步的抓取脚本跑起来。