杭州服装电商品牌”云裳集”(年GMV 8000万)的设计总监陈晨,无意中发现他们的产品图出现在Kimi的多模态搜索结果中。用户搜索”2025年春季女装流行色”时,Kimi不仅给出了文字回答,还在回答中展示了一张他们产品的搭配图。
陈晨立即调查这张图为什么会被AI引用。原来,他们为每张产品图都添加了详细的Alt文本和结构化描述,用的是品牌内部的一套”图片SEO规范”。这个习惯在传统SEO中没有带来显著的流量,但在AI多模态搜索中,却成了被引用的关键。
更让她意外的是,这张被AI引用的产品图带来的流量,是同期文字内容流量的3倍。用户看到图片后直接搜索了他们的品牌。
这个发现让”云裳集”意识到:多模态内容(图片、视频、音频)在AI搜索中的GEO价值,正在快速超越纯文字内容。
2024-2025年,ChatGPT、Kimi、百度文心一言等主流AI搜索平台相继推出多模态功能。用户不再只能通过文字提问,还可以上传图片搜索相似商品、通过语音提问获取回答。AI搜索引擎对多模态内容(图片、视频、音频)的索引和引用能力正在快速增长。
大多数企业的图片缺少详细的Alt文本、视频缺少字幕和结构化描述、音频缺少文字稿和章节标记。AI爬虫虽然能”看到”图片和”听到”音频,但无法理解其中的具体内容。
一张只有”product.jpg”文件名的图片、一个只有标题没有章节标记的视频、一个没有文字稿的播客——AI搜索引擎很难将这些内容作为回答的引用来源。
“云裳集”的解决方案围绕三个内容类型展开:图片优化、视频优化、音频优化。
这是最容易见效的多模态优化方向。核心是让每张图片都成为AI可独立检索和引用的”内容单元”。
图片文件命名规范:
# 错误示例
IMG_20250101_12345.jpg
# 正确示例
2025-春季-女装-法式碎花连衣裙-云裳集-杏色.jpg
Alt文本规范:
<!-- 差 -->
<img src="dress-1.jpg" alt="连衣裙">
<!-- 优 -->
<img src="2025-spring-floral-dress-yunshangji.jpg"
alt="云裳集2025年春季法式碎花连衣裙,杏色,V领设计,中长款收腰版型,面料为100%棉质,适合日常通勤和约会穿搭"
title="云裳集2025春季法式碎花连衣裙"
data-description="产品名称:法式碎花连衣裙 | 品牌:云裳集 | 季节:2025春季 | 颜色:杏色 | 面料:100%棉 | 版型:收腰中长款 | 适用场景:日常/通勤/约会 | 搭配建议:白色高跟鞋+编织包">
使用Python脚本批量生成Alt文本:
def generate_image_alt_text(product_data):
"""生成包含丰富信息的Alt文本"""
template = "{brand}{year}年{season}{product_name},{color},{features},{fabric},适合{scenarios}"
alt_text = template.format(
brand=product_data["brand"],
year=product_data["year"],
season=product_data["season"],
product_name=product_data["name"],
color=product_data["color"],
features=product_data["features"],
fabric=product_data["fabric"],
scenarios="、".join(product_data["scenarios"])
)
return alt_text
# 批量处理
products = [
{"brand": "云裳集", "year": "2025", "season": "春季", "name": "法式碎花连衣裙",
"color": "杏色", "features": "V领设计,中长款收腰版型", "fabric": "100%棉质",
"scenarios": ["日常通勤", "约会穿搭"]},
# 更多产品...
]
for product in products:
alt_text = generate_image_alt_text(product)
print(f"Alt文本: {alt_text}")
图片结构化数据:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "ImageObject",
"contentUrl": "https://www.yunshangji.com/images/2025-spring-dress.jpg",
"name": "云裳集2025年春季法式碎花连衣裙",
"description": "云裳集2025年春季新品,法式碎花连衣裙,杏色,V领收腰设计",
"about": {
"@type": "Product",
"name": "法式碎花连衣裙",
"brand": {"@type": "Brand", "name": "云裳集"},
"category": "女装/连衣裙/春季"
},
"datePublished": "2025-02-15",
"author": {
"@type": "Organization",
"name": "云裳集"
}
}
</script>
AI搜索对视频内容的索引能力在快速增强,但前提是视频内容必须”可解析”。
1. 添加精准字幕文件
不要依赖AI自动生成字幕(准确率约80%),而是上传人工校对过的SRT字幕文件:
1
00:00:05,000 --> 00:00:15,000
欢迎收看云裳集2025年春季新品开箱。今天我们来试穿这款法式碎花连衣裙,杏色,100%纯棉面料,V领收腰设计。
2
00:00:15,000 --> 00:00:30,000
这款连衣裙最大的亮点是它的版型。收腰设计能够很好地勾勒身材比例,A字裙摆对梨形身材非常友好。建议搭配白色简约配饰。
3
00:00:30,000 --> 00:00:45,000
现在我们来看一下实际穿着效果。模特身高168cm,体重55kg,穿M码。可以看到裙长在膝盖下方约15cm,非常优雅。
2. 添加视频章节标记
在YouTube/B站上传视频时,添加章节时间戳,帮助AI搜索引擎理解视频结构:
00:00 开箱展示
00:30 面料细节
01:15 试穿效果
02:30 搭配建议
03:45 尺码参考
05:00 购买信息
3. 部署VideoObject Schema
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "VideoObject",
"name": "云裳集2025春季法式碎花连衣裙开箱试穿",
"description": "云裳集2025年春季新品开箱,试穿法式碎花连衣裙,展示面料细节、版型效果和搭配建议",
"thumbnailUrl": "https://www.yunshangji.com/videos/thumbnail-dress.jpg",
"uploadDate": "2025-02-20",
"duration": "PT5M30S",
"contentUrl": "https://www.yunshangji.com/videos/spring-dress-2025.mp4",
"embedUrl": "https://www.bilibili.com/video/BVXXXXX",
"transcript": "欢迎收看云裳集2025年春季新品开箱...",
"keywords": ["云裳集", "春季女装", "碎花连衣裙", "法式穿搭", "2025春季"],
"hasPart": [
{"@type": "Clip", "name": "开箱展示", "startOffset": 0, "endOffset": 30},
{"@type": "Clip", "name": "面料细节", "startOffset": 30, "endOffset": 75},
{"@type": "Clip", "name": "试穿效果", "startOffset": 75, "endOffset": 150}
]
}
</script>
音频内容在AI搜索中的可发现性相对较低,但优化得当也能成为AI引用的来源。
1. 发布完整文字稿
每个播客或语音内容都必须附带完整的文字稿。AI搜索可以直接引用文字稿中的内容,而无需”听”音频。
# 云裳集时尚播客第12期:2025年春季流行趋势解读
**嘉宾**:陈晨(设计总监), 小林(时尚买手)
**时长**:35分钟
**发布时间**:2025-02-10
## 文字稿
**[00:00] 开场**
主持人:欢迎收听云裳集时尚播客,今天我们来聊聊2025年春季的流行趋势...
**[05:30] 流行色解析**
陈晨:今年Pantone发布的年度色是"宁静蓝",这个颜色对亚洲肤色非常友好...
2. 添加章节标记
章节标记:
00:00 - 开场和本期内容介绍
02:30 - 2025年春季流行色趋势
08:15 - 连衣裙的5大流行元素
15:00 - 通勤穿搭的3个实用技巧
22:30 - 本季必入单品推荐
30:00 - 听众问答环节
3. 部署AudioObject Schema
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "AudioObject",
"name": "云裳集时尚播客:2025年春季流行趋势解读",
"description": "深度解读2025年春季流行趋势,包括流行色、连衣裙元素、通勤穿搭技巧",
"duration": "PT35M",
"contentUrl": "https://www.yunshangji.com/podcasts/spring-trends-2025.mp3",
"datePublished": "2025-02-10",
"transcript": "欢迎收听云裳集时尚播客...",
"author": {
"@type": "Organization",
"name": "云裳集"
},
"keywords": ["春季流行趋势", "2025时尚", "女装搭配", "云裳集播客"]
}
</script>
# n8n工作流
触发器: 内容管理系统有新内容发布
图片内容处理流程:
→ 步骤1: 读取上传的图片文件
→ 步骤2: 根据产品信息自动生成Alt文本
→ 步骤3: 生成ImageObject Schema
→ 步骤4: 自动重命名文件为SEO友好格式
→ 步骤5: 写入CMS的Alt文本和Schema字段
视频内容处理流程:
→ 步骤1: 接收上传的视频文件
→ 步骤2: 调用语音识别API生成字幕
→ 步骤3: 人工校对字幕(影刀RPA发送审核任务)
→ 步骤4: 生成VideoObject Schema
→ 步骤5: 同步字幕到YouTube/B站
音频内容处理流程:
→ 步骤1: 接收音频文件
→ 步骤2: 调用语音识别API生成文字稿
→ 步骤3: 自动添加章节标记
→ 步骤4: 生成AudioObject Schema
→ 步骤5: 发布文字稿到官网
def monitor_multimodal_references():
"""监测多模态内容在AI搜索中的引用情况"""
platforms = ["chatgpt", "kimi", "wenxin"]
for platform in platforms:
# 检查图片引用
image_prompt = "搜索2025年春季法式碎花连衣裙"
# 检查视频引用
video_prompt = "推荐2025年春季女装穿搭视频"
# 检查播客引用
audio_prompt = "推荐女装搭配的播客节目"
# 记录引用情况
print(f"平台: {platform}")
“云裳集”执行多模态GEO策略3个月后的数据:
“连衣裙、碎花裙、法式连衣裙、春季连衣裙、2025连衣裙”这种Alt文本堆砌关键词的行为,AI搜索引擎能识别并降低权重。Alt文本应该是一个自然的描述语句。
即使视频内容再好,如果没有字幕或文字稿,AI搜索引擎几乎无法引用视频中的具体信息。文字稿是视频被引用的”必要条件”。
很多企业认为音频内容(播客)在AI搜索中没有价值。但AI搜索的多模态能力正在覆盖音频领域,有完整文字稿的播客内容正在成为一个”低竞争高回报”的GEO蓝海。
图片、视频、音频之间没有互相链接。AI搜索引擎在评估内容时,如果图片和视频之间有互链,会认为这是”富媒体知识网络”,提升整体的引用评分。
即使图片Alt文本写得再好、视频字幕再精准,如果没有VideoObject/ImageObject Schema标记,AI搜索可能无法将这些内容识别为”结构化媒体内容”,引用的概率会降低50%以上。
多模态搜索是AI搜索的下一个战场。当用户不再只通过文字提问,而是通过图片搜索、语音提问时,企业需要让每一个媒体文件都成为AI可检索、可理解、可引用的”内容单元”。
多模态GEO的核心优化:
1. 图片:详细的Alt文本 + ImageObject Schema
2. 视频:精准字幕 + 章节标记 + VideoObject Schema
3. 音频:完整文字稿 + 章节标记 + AudioObject Schema
立即行动:
1. 为所有产品图片添加详细的Alt文本
2. 为所有视频添加人工校对字幕
3. 为播客内容发布完整文字稿
4. 部署VideoObject/ImageObject/AudioObject Schema
现在开始布局多模态GEO,当AI搜索全面进入多模态时代时,你的内容将比其他竞争对手更早被AI”看见”和”引用”。
需要多模态GEO工具?我们提供批量图片Alt文本生成器、视频字幕自动生成+校对工作流、播客文字稿AI生成工具!