搜索引擎营销(Search Engine Marketing, SEM)借助关键词竞价,把广告推送给有明确搜索意图的用户,是企业获取精准流量并促成转化的一条主要途径。这几年关键词单次点击价格不断走高、同行抢量也越来越凶,光靠堆预算换曝光的老办法已经撑不住,钱花出去却不见得换来相称的回报。本文基于某互联网公司2025年的SEM投放数据——5个投放方案、12个推广单元、2227个实际投入运行的关键词、全年共142.59万元——针对投放策略是否合理、关键词如何按成本—效益归类、预算约束下怎样优化投放,以及在不确定环境下怎样预测投放效果这四个环节,搭起了一套“评价—分类—优化—预测”的数学建模框架。
问题一沿着“展现→点击→浏览→注册”这条转化漏斗,建立了效益评价指标体系,再从广告设计与创意、关键词管理、出价与预算、投放时段四个角度去判断这套策略是否合理。跑出来的结果是:全年累计展现2258.04万次、点击83.48万次、新注册85313人,整体点击率3.70%、平均点击成本1.71元、平均注册成本16.71元、点击注册转化率10.22%,说明大的方向是对的。但细看就能发现结构上的失衡——上方位广告只用掉27.71%的展现量,却吃掉了70.35%的预算;关键词消费是极典型的极端长尾,前1.2%的词贡献了80%的消费,还有40.0%的词整年一分钱没花。把日期拉出来看,投放节奏存在“周二到周四高、周一和周日低”的周规律(单因素方差分析p<0.001);假日的表现更是分裂:节假日日均消费比工作日掉了79.4%,可Welch t检验显示,节假日和工作日的转化率其实没有显著差别(p=0.222),五一和中秋国庆的注册成本甚至低到8.92元和10.79元。换句话说,转化效率最高的假日窗口,公司反而主动收了量,白白放过了便宜的好流量。 问题二先取了点击量、浏览量、用户粘性(1−跳出率)、平均访问时长这四个指标,因为分布都拖着长尾,所以先取对数压缩再极差归一化,然后用熵权法按各指标的实际离散程度客观赋权(四个权重分别是0.294、0.179、0.426、0.101),最后以TOPSIS贴近度合成出每个关键词的效益综合指数。分类时以成本中位数8.06元、效益中位数0.2425为两条分割线,搭了一个BCG式的四象限模型,顺便把既没花钱也没点击的词划进无效词。最终分出来:黄金词229个(10.3%)、重点词439个(19.7%)、潜力词442个(19.9%)、问题词227个(10.2%)、无效词890个(40.0%)。重点词用掉99.36%的消费,却换回了99.10%的点击;黄金词的跳出率平均才0.24。这套分法在业务上说得通,再用K-means聚类做校验,一致率和轮廓系数都说明分类是站得住脚的。详细结果保存在result2.xlsx。
问题三用日度面板数据,先对新注册数关于各推广单元点击量做非负最小二乘(NNLS)归因,拟合优度R²=0.674;由于有些单元样本量小,再按点击规模加权的经验贝叶斯收缩来估各单元的点击注册转化率,避免小单元被噪声带偏。接着把关键词“点击—成本”的关系写成幂律响应函数,响应指数γ=0.85,表达边际收益递减。投放时直接拿问题二的词类当门槛:问题词、无效词一律不投;每个单元某天的预算上限定为该单元2025年同日的实际消费。目标是在“花完且不超预算”的约束下让预期注册量最大,这是一道凸优化题,依据边际收益相等(water-filling)的原理,配合二分法即可拿到全局精确解。把这套解法用到2025年2月1—8日与8月1—8日共16天,预算总额仍是51165元,预期注册量从基线2807.6人涨到3527.8人(+25.65%),综合注册成本从18.22元压到14.50元(−20.4%),提升相当实在。逐日逐词的明细见result3.xlsx。
问题四把不确定性叠进来,先对点击率和转化率做Beta-Binomial贝叶斯后验估计,再用对数残差法估各单元的日度波动率——消费、点击、展现、CPC的中位数波动率依次是0.788、0.758、0.673、0.224。波动结构上区分了全市场公共冲击和单元个体冲击两层,合起来构成乘性对数正态随机模型。预算基准取自2025年9月11—17日的实际消费,总额23488元,确保不超过2025年总投入;优化以条件风险价值(CVaR)作鲁棒准则,每天抽一次样就重解一遍问题三的模型,跑满2000次蒙特卡洛模拟后汇总出每日最优策略和各项指标的期望区间。模拟下来,这7日期望投入23234元、期望点击16800次、期望注册1619人、期望注册成本14.35元;单看9月11日,期望点击4298次(90%置信区间[1060, 10210])、期望注册414人(90%置信区间[103, 985])、CPC期望2.02元。和2025年同期实际比,9月11—14日的期望点击大约提升了37.6%。明细见result4.xlsx。 灵敏度方面,把响应指数γ在[0.75, 0.95]之间挪动,注册提升率落在+17.4%~+37.5%;扩容系数H取[2, 6]时对应+15.1%~+29.3%;收缩系数K无论怎么变,提升率都贴在+25%附近。即便把预算上下扰动20%,预期注册量也只在85.8%~105.3%区间里晃,说明结论不是靠某个参数硬撑出来的。整套模型分层清楚、权重靠数据说话、求解足够精确,分出来的类、算出来的投放方案都能直接变成一张张操作清单,对SEM乃至信息流广告的精细运营都有可照搬的地方。
关键词:SEM广告;熵权TOPSIS;四象限分类;幂律响应函数;凸优化;贝叶斯预测;蒙特卡洛模拟;鲁棒优化
搜索引擎营销(SEM)按关键词竞价排位,把广告投给正在主动搜索的人,好处是反馈快、数据可量化,但受竞价、流量等诸多不确定因素影响,是互联网产品拉新的一条实在路径。可现在单次点击越来越贵、抢量越来越卷,光靠加预算铺量的老打法已经不灵,花出去的钱和换来的效果常常对不上号。摆在SEM运营面前的难题很现实:在预算有限时,怎么靠科学的关键词管理和投放安排,把综合效益做到最大。
有家互联网公司给自己的某款产品投了SEM广告,设计了5个投放方案、12个推广单元,候选关键词有6000多个(2025年实际跑起来的是2227个),全年砸进去约142.59万元,确实带来了一些转化。手上握着一整年的投放和效果数据(附件1),公司想借数学建模给现有策略把把脉,顺带把关键词结构和预算分配调优,好给2026年做投放决策时心里有底。
问题一:依托附件1里的2025年数据,从广告设计与创意、关键词管理与运用、出价策略与预算、投放时段这几个角度,评判这家公司SEM投放策略合不合理,并把投放效益随时间的波动规律以及假日效应一并摸清楚。
问题二:从投入成本和产出效益两个维度,把关键词切成五类——黄金词(低成本高效益)、重点词(高成本高效益)、潜力词(低成本低效益)、问题词(高成本低效益)、无效词(无成本无效益),列出主要分类结果并存入result2.xlsx。
问题三:接着问题一、二往下走,按照关键词的类型和彼此关联,在满足各推广单元“低成本、高效益、花完且不超预算”的前提下挑词,为每个单元及其关联关键词建一个投放模型,给出2025年2月1—8日和8月1—8日每天的优化投放方案,并讲清楚它好在哪,明细放进result3.xlsx。
问题四:2026年公司打算沿用2025年的方案、推广单元和关键词接着投,预算不超过2025年总投入。考虑到竞价每天在变,展现量、展现位、点击量、浏览量、注册量也都跟着抖,需要给出2026年9月11—17日每天的优化投放策略,并估出各项指标的期望区间,明细见result4.xlsx。
附件1一共三张表。Sheet1是2627条“日期—方案—推广单元”粒度的投放与消费流水,字段含展现量、点击量、消费额、上方位展现量、上方首位展现量、上方位点击量、上方位消费额;Sheet2是365天里每天的新注册人数;Sheet3是2227条关键词的年度累计统计,含消费额、点击量、浏览量、跳出率和平均访问时长。三张表的时间口径(日/年)和组织口径(单元/关键词)对不齐,得先汇总统一才能往下用。我们核验过,数据没有空缺也没有重复记录,只是Sheet3里有些“/”占位符(
对应没有浏览行为的关键词,跳出率和访问时长留空),另外大约40%的关键词全年零消费——这正是长尾SEM账户的典型样子。
问题一实质上是给投放策略做一次诊断性评价。SEM的效果是顺着“展现→点击→浏览→注册”漏斗一级级漏下去的,所以只看消费额或点击量远远不够,得搭一套多维指标:用点击率(CTR)看广告创意抓不抓人,用跳出率和平均访问时长看落地页质量,用关键词消费的集中度和零消费占比看关键词管得好不好,用平均点击成本(CPC)和上方位展现占比看出价策略,用注册成本(CPA)看预算花得值不值。时间那条线,把日度序列按星期、月份、法定节假日切块,再用方差分析、假设检验和哑变量回归把周规律、月规律和假日效应定量刻画出来。这里有个绕不过去的坎:Sheet2的注册数是公司总量,拆不到单元头上,只能靠漏斗里各环节的指标间接推断各环节的质量。
问题二要做的,是在“成本—效益”这张二维图上把关键词分成五类。成本那一侧直接拿年度消费额就行;效益这一侧没有现成的注册归因数据,只能综合点击量、浏览量、跳出率、平均访问时长这四个看得见的指标,凑出一个综合效益指数。四个指标量纲不一又都拖着长尾,所以先做对数变换再归一化;为了不让权重带主观任意性,改用熵权法,按各指标的离散程度客观定权,再用TOPSIS贴近度合成效益得分。阈值直接取成本和效益的中位数,四象限就自然出来了,再叠一条“零消费零点击”的判据把无效词捞出来。这套规则在业务上能讲得通,最后还能用K-means聚类复核一遍分得稳不稳。
问题三说到底是预算卡死下的资源分配。每个推广单元各自有当天的预算(顶多到2025年同日的实际消费),要在单元内部把这些钱在关联关键词之间重新摆布。建模绕不开两件事:第一,关键词投进去能换来多少注册——用单元级的点击注册转化率把“点击”折算成“注册”,但单元转化率没法直接看到,得靠日度面板数据做归因回归,样本小的单元再上贝叶斯收缩兜底;第二,给某个关键词加钱后点击怎么涨——广告投放有边际收益递减,用幂律(凹)响应函数描述比较贴,参数由历史日均数据标定。这两步就位后,拿问题二的词类当0-1选词开关(问题词、无效词直接出局),以预期注册量最大为目标立一个凸优化模型;由KKT条件导出的边际收益相等原理可以精确求解,不必退而求其次用启发式算法,也就不会丢解的质量。
问题四在问题三的架子上再加一层不确定性,落到随机环境下的优化与预测。2026年的关键词竞价、展现量、点击量等都是随机变量:对点击率和转化率,可以用Beta-Binomial共轭模型给出贝叶斯后验估计;各单元指标的波动率则来自2025年日度数据的对数残差,并假定随机冲击服从乘性对数正态分布,且把全市场公共冲击和单元个体冲击分开。接着用蒙特卡洛模拟,每抽一组样本就重解一次问题三的模型,把最优策略下各指标的分布统计出来,再拿条件风险价值(CVaR)准则把最坏情景也兜住,从而得到稳健的期望投放策略和期望区间。
预算这边用2025年9月11—17日的实际消费当2026年同期的单元日预算基准,确保“预算不超过2025年投入”。
(1)附件里的数据真实、准确,能反映该公司2025年SEM投放的整体状况,没有系统性的记录偏差;
(2)新注册用户主要来自SEM广告点击转化,自然注册等其他渠道占比固定,不影响不同策略之间的相对比较;
(3)同一个推广单元内的关键词共用该单元的流量结构和转化水平,单个关键词的注册转化率可用其所属单元的点击注册转化率近似替代;
(4)关键词的点击-成本响应关系在观测期内保持稳定,市场搜索需求的总量结构不会出现突变;
(5)竞价、点击率、注册转化率等指标的日度相对波动相互独立(或仅通过公共冲击相互牵连),且服从对数正态分布,2026年的市场环境与2025年同期平稳衔接;
(6)公司各推广单元的日预算视为刚性约束:2025年优化时单元日预算不超该单元2025年同日实际消费,2026年不超2025年同期实际消费,且总预算不超过2025年总投入;
注:未列出及重复出现的符号在文中首次出现时另有说明。
对附件1三张表做了下面几步处理:(1)Sheet3的跳出率字段里有“/”缺失标记,核查后发现都出在零消费、零点击的关键词上,而这批词正是问题二划定的无效词,不进效益指数计算,所以不必插补;平均访问时长统一换算成秒。(2)Sheet1和Sheet2按日期做外连接对齐后没有缺口,没有投放记录的日期消费指标补0;Sheet1消费总额1425949.79元,Sheet3是1425949.81元,只差0.02元(四舍五入导致),说明两张表内部对得上。(3)Sheet3的2227个关键词里,全年消费和点击都为零的有890个,占40.0%,剩下1337个真有消费的词才进入后续建模。(4)日度指标再做一次7日滑动平均,主要用来压一压随机噪声、方便展示时间规律;但凡是统计检验,都基于原始日度数据。
几个派生指标的定义如下:CTR = 点击量/展现量,CPC = 消费额/点击量,CPM = 消费额/展现量×1000,CPA = 消费额/新注册数,CR = 新注册数/点击量,上方位占比PR = 上方位展现量/展现量,首位率 = 上方首位展现量/展现量。
预处理完,全年大盘是:消费142.59万元,展现量2258.04万次,点击量83.48万次,新注册85313人;整体点击率3.70%,平均CPC 1.71元,平均CPA 16.71元,点击注册转化率10.22%。把日消费额和日新注册数对一下,
皮尔逊相关系数有0.94,点击量和注册量的相关系数也有0.88,可见预算往哪投、转化就跟着动,这中间优化能抠出来的收益是实打实的。
SEM广告的转化漏斗是“展现→点击→浏览→注册”。顺着这条线,我们定义了五个核心效益指标:点击率CTR看广告创意对用户有没有吸引力;单次点击成本CPC看竞价贵不贵;单次注册成本CPA看拉来一个注册用户总共要花多少;点击注册转化率CR看流量最终的质量;上方位展现占比PR则看出现价策略能不能把广告顶到搜索结果首页上方的好位置。公式如下:
CTR = C / I, CPC = A / C, CPA = A / N (1)
CR = N / C, PR = T / I (2)
这几个指标里,CTR、CR、PR是越大越好,CPC、CPA则越小越好。五个指标分别从创意质量、成本水平、综合效益、流量质量、出价竞争力这五个侧面把投放效果勾勒出来。
广告设计质量与创意包含展现量、点击率CTR和上方位点击率,并最终由点击率CTR进行体现。关键词管理运用包含关键词数量、无效词占比和关键词的转化分布,受CPA影响。投放策略与时间效应包含
日ROI时序波动和节假日指标,由CR反应,出价策略与预算分配包含单次点击成本CPC,上方为消费占比和总消费额,落脚在综合效益PR上。广告创意与落地页质量无法直接观测,用跳出率与平均访问时长间接衡量。全年有消费关键词的加权平均跳出率约为0.65,分化明显:单元8878077181(仅4个关键词)跳出率低至0.09、平均访问时长666秒、CTR高达66.07%,属于典型的品牌词单元,创意与落地页高度匹配;而单元2874903000、9628223555的平均跳出率达0.89、0.77,平均访问时长不足160秒,说明部分单元的广告创意与落地页内容未能承接用户预期,创意质量有较大改进空间。整体CTR为3.70%,处于搜索广告的中等水平。
对2227个关键词的消费作帕累托分析(图1):前26个关键词(占1.2%)贡献了80%的消费,前20%的词贡献了99.7%的消费与99.4%的点击,长尾特征极为显著;与此同时,890个关键词(40.0%)全年零消费、零点击,处于"僵尸"状态。这表明公司关键词库存在明显的管理冗余:大量无效词占据管理资源而未产生任何效益,而真正创造价值的头部词数量极少。
全年平均CPC为1.71元。分方案看,通过“GSP与漏斗恒等式(pandas)”原理可得方案500635396上方位展现占比达43.49%、CPC为2.24元,出价积极但成本偏高,但方案525368335上方位占比仅8.92%,广告大多出现在非醒目位置,CTR也仅2.10%,出价竞争力明显不足。品牌词单元以0.60-0.74元的低CPC即获得81.89%的上方首位展现占比,出价效率最高。预算方面,利用“时序波动与边际控制(pandas & statsmodels)”原理及“相关性与离群点检测(scipy)”原理得出全年月度消费波动剧烈:3月高达20.30万元,而7月仅6.99万元,相差近3倍,预算投放缺乏平稳节奏(图2)。
图2 2025年各月消费额、注册数与CPA、转化率
运用时序滤波与平滑原理,借助pandas滚动窗口或numpy卷积函数得到图3,展示了经7日滑动平均处理后的公司全年日消费额‑新注册数时间序列。通过“多变量协动性与相关性原理”计算皮尔逊相关系数、进行回归分析(验证“正比”关系)与“时间序列的季节性与周期分解原理” 将序列拆分为趋势、季节、残差分别可得结论:两条曲线高度联动,消费额与新注册数基本呈正比;春节、五一、中秋国庆等节假日出现明显的"V"形下探,消费额与新注册数大幅下降。根据干预分析与事件冲击原理,检测曲线是否在特定时间点发生了结构性改变,证明公司在节假日主动大幅缩减甚至暂停投放。
图3 2025年日消费额与新注册数时间序列(7日滑动平均)
图3给出全年日消费额与新注册数的时间序列(7日滑动平均)。可见两条曲线高度联动(相关系数0.94),春节、五一、中秋国庆等节假日出现明显的“V”形下探,说明公司在节假日主动大幅缩减甚至暂停投放。为定量刻画时间规律,对日度序列作加法分解并建立哑变量回归:
这里的Weekend是周末哑变量,Holiday是法定节假日哑变量,Promotion是618、双11这类大促哑变量,回归得到的结论和下文的分组检验能互相印证。
把日度数据按星期拆开做单因素方差分析(图4):消费额F=12.678(p<0.001),注册数F=9.479(p<0.001),星期效应显著。周二到周五是投放高峰(日均消费约4500~4800元、日均注册270~279人),周一和周日明显缩了(日均消费1952元、2409元,日均注册143人、158人)。可看转化率就露馅了:周一、周日的点击注册转化率并不比工作日低,周末CPA(17.60元)甚至比工作日的17.84元还略好一点——也就是说,在流量竞争不那么凶的时段,公司反而收了量,落下了“周一启动慢、周末红利闲着”的时间错配。
把全年28天法定节假日(元旦、春节、清明、五一、端午、中秋国庆)和平常工作日摆到一起比,结果见表3和图5。节假日日均消费890元,比普通工作日的4320元降了79.4%;日均注册62.5人,降了76.0%。Welch双样本t检验给出:消费额差异t=−17.478(p<0.001),注册数差异t=−18.665(p<0.001),假日效应极其明显;但点击注册转化率的差异t=1.233(p=0.222),不显著——换句话说,节假日流量质量和工作日差不多。再细看,五一、中秋国庆期间的CPA分别只有8.92元、10.79元,远低于全年均值的16.71元;端午节CPA冲到25.14元,效果明显变差;春节期间公司几乎停摆(日均展现不到全年均值的7%),把一部分低成本的流量窗口给放掉了。
表3 2025年主要节假日与普通工作日投放效益对比
图5 主要节假日日均消费与注册对比(虚线为工作日水平)
结论很清楚:节假日的SEM流量转化效率没降,部分假日拉一个注册的成本反而更低,公司却把投放规模压到工作日的差不多两成,这是明摆着的策略失误——假日窗口里其实藏着被忽视的便宜好流量。公司对假日投放缺少差异化预案:像五一、十一这种高效假日没追加预算,而端午这类低效假日又没及时收手。 把四个维度合起来看:公司SEM投放策略“框架合理、精细不足”,大体是有效的——全年用16.71元的CPA换到8.53万注册,品牌词单元运营成熟,预算盘子也控得稳;但毛病也有四处:(1)关键词库冗余,40%的词全年无效,消费又高度堆在极少数头部词上;(2)部分单元广告创意和落地页质量差,跳出率逼近0.9,创意质量“前强后弱”;(3)方案525368335这类单元出价不够,上方位占比不到10%,而个别方案又出价偏猛,方案之间缺一套动态调预算的机制;(4)时间分配错位,周一、周日和法定节假日投放收得太狠,把低竞争、低CPA的优质流量窗口给错过了。这些结构性问题,恰好就是问题二到问题四要动手优化的地方。
关键词的“效益”得同时看流量规模和流量质量。我们挑了四项:点击量(流量获取能力)、浏览量(内容吸引深度)、
用户粘性(1−跳出率,访问质量)、平均访问时长(用户关注度),四项都是正向指标。点开看,点击量和浏览量都是极端长尾(点击最多的词有124758次,中位数却只有个位数),所以先取对数变换ln(1+x)把量纲差距压下去,再做极差归一化:
rkj = [ ln(1+xkj) − min ln(1+xj) ] / [ max ln(1+xj) − min ln(1+xj) ] (4)
熵权法按指标的信息熵来客观定权:某个指标离散得越开,它对分类的区分力就越强,分到的权重也越大。对归一化矩阵R=(rkj),先算第j项指标下第k个关键词的比重pkj,再得到信息熵ej与权重wj:
pkj = rkj / Σk rkj, ej = −(1/ln n) Σk pkj ln pkj, wj = (1−ej) / Σj (1−ej) (5)
熵权算完之后,再用TOPSIS(逼近理想解排序法)把各项指标合成一个效益综合指数。具体做法是先构造加权规范化矩阵vkj = wj·rkj,分别取正理想解vj⁺ = maxk vkj和负理想解vj⁻ = mink vkj,接着算出每个关键词到这两个理想解的欧氏距离Dk⁺、Dk⁻,最后用贴近度来代表效益综合指数:
Ek = Dk⁻ / (Dk⁺ + Dk⁻), Dk± = √[ Σj (vkj − vj±)² ] (6)
这里Ek落在[0,1]区间,数值越靠近1,说明该关键词的综合效益越贴近理想状态。熵权TOPSIS把客观赋权和相对排序结合起来,比起简单地加权求和,它更能把头部的优质词和尾部的低效词区分开。
成本这一维用关键词的年度消费额Ck来度量。我们拿1337个有实际消费的关键词作为样本,取成本中位数θc=8.06元和效益指数中位数θe=0.2425当阈值,把“成本-效益”平面切进四个象限;至于全年既没消费也没点击的词,就直接归入无效词。具体怎么分,表4列得清楚。
光看中位数阈值分类还不够踏实,于是我们再用成本和效益两个特征对关键词做了一轮K-means聚类(聚类数k=5)来交叉验证:聚类轮廓系数大于0.5,说明簇分得还算清楚;拿它跟四象限分类比,
类别归属一致率为66.0%,像黄金词、问题词这些主要词类的落位基本没动,可见中位数阈值这套分法既稳当又说得通。
分类出来的结果见表格5、图6和图7,而每个“方案—推广单元”对应的明细词表(一共2227行,跟附件2的模板对得上)已经存进result2.xlsx了。
图6 关键词成本-效益四象限分类散点图(虚线为分类阈值)
结果分析:(1)黄金词一共229个,靠平均2.90元的单词年消费就换来了高粘性流量(平均跳出率0.24、平均访问时长369秒),大多属于精准长尾词或品牌词,性价比最高,预算宽裕时应该先给它加量。(2)重点词有439个,却扛起了99.36%的消费和99.10%的点击,是公司投放当之无愧的主力,日常盯着排名、把CPC控住就行。(3)潜力词加问题词共669个,跳出率都超过0.92、访问时长只有约82秒,流量质量很差;问题词尤其不划算,年均单词花31.65元,一年烧掉7185元只换来5295次低质点击,省预算得先从这儿动刀。(4)无效词890个(占39.96%)一直白白占着账户管理精力,不如清掉,或者换个新创意试着救活。(5)图7里单元9811363528的词类最杂,
577个词里无效词差不多占八成,堪称词库治理的头号对象。这套分类跟问题一找出的长尾失衡对得上,也给问题三的选词优化打下了底。
关键词这一层级的注册量是看不见的,得先架一座“点击→注册”的归因桥。我们假定第t天全公司的注册数Rt,就是12个推广单元当天点击量cu,t各自按转化率βu累加起来,再拿365天的日度面板数据去跑非负最小二乘(NNLS)估计:
Rt = Σu βu·cu,t + εt, minβ≥0 Σt ( Rt − Σu βu cu,t )² (7)
上面式子里β̂u是NNLS估出来的,β̄=0.1022是全局转化率,Cu是单元u一整年的点击总量,K=20000是收缩系数。小样本的单元会被狠狠拉向全局水平,大样本的则保留自己的估计,这样物理约束和估计稳定性就都顾上了。收缩完之后,各单元转化率分布在0.037(单元9628223555)到0.253(单元4190988310)之间,其中单元9811363528为0.142、单元9657930100为0.113,是转化能力最突出的两个主力单元。
ck(x) = Ak·xγ, 0 < γ < 1, Ak = Ck / Skγ (9)
式中的γ是响应指数,我们取γ=0.85(后面的灵敏度分析显示,γ在[0.75, 0.95]里结论都成立);
Ak则按历史日均消费Sk和日均点击Ck标定,好让函数能穿过历史观测点。日投入自然不能无限涨:搜索总量摆在那儿,于是规定日投入上限为H·Sk,H=4即扩容系数——之所以这么定,是因为各单元上方位的展现占比大多不到50%,就算提价最多也只多买到当前几倍的高位流量,取4倍算是个保守的顶。
顺着问题二的分类,我们直接拿词类当0-1选词开关:问题词和无效词一律不投(x=0),黄金词、重点词、潜力词才进预算分配;同一个推广单元里的关键词互为关联词,共用单元预算、合力覆盖同一拨用户,天然就成了一簇。再把2025年同日该单元的实际消费当作单元日预算Bu,d(也就是“完成但不超过预算”),以当天预期注册总量最大化为目标,搭起一个凸优化模型:
s.t. Σk∈G xk ≤ Bu,d, 0 ≤ xk ≤ H·Sk·fu,d (11)
上式里G是单元u内可投放的关键词集合,fu,d = Bu,d/(单元日均消费)当作当日流量强度系数,用来把词级产能校准到当天的节奏。由于这是可分离凹函数在单一线性约束下求最大,由KKT条件可以推出:那些没触到上界的关键词,在最优点上的边际收益必然相等:
换句话说,预算得照着“各词边际注册产出相等”来分(这就是water-filling原理)。借这个性质,只要对乘子λ做二分搜索,就能拿到全局精确解:给定λ,每个词的最优投入就是xk(λ) = min{(λ/(βu Ak γ))1/(γ−1), H·Sk·fu,d},
再调λ直到预算刚好花完。这套算法面对每个(单元,日期)子问题都是毫秒级收敛,用不着通用求解器,扩到几万个关键词也不在话下;我们还顺手做了交叉验证——把投入离散化后跑多重背包0-1整数规划、用HiGHS分支定界求解,结论跟凸优化解对得上。
我们挑了2025年两段日子逐天求解:2月1—8日是春节假期投放低谷,只有2个推广单元真有消费、预算也小;8月1—8日则是暑期高峰,12个单元全在线。16天的优化结果汇总在表6,每天的变化对比见图9。逐日逐词的投放明细(日期、方案、推广单元、关键词、投入金额、预期展位、预期点击量、预期浏览量、预期注册量,合计4002行)都已经存进result3.xlsx。
表6 2025年2月与8月各8天的逐日优化结果(基线为历史投放结构)
结果分析:(1)预算效率提得相当明显。16天总预算51165元不动、每天每单元都没超支的前提下,预期注册总量从基线2807.6人抬到3527.8人,涨了25.65%;综合CPA则从18.22元/注册降到14.50元/注册,降幅20.4%。(2)这多出来的量来自两处:一是把问题词的预算抠出来,挪给同单元里高ROI的黄金词和重点词;二是在重点词内部,预算按边际收益相等的原则,从高CPC词往低CPC词上挪。(3)2月春节那几天每天提升都稳在21%~24%,8月则在18%~43%之间波动,其中8月1—2日(周五、周六)冲到近40%,又一次坐实了问题一看到的周末/假日流量红利,也印证了“低效期收缩、高效期发力”这套差别化打法。(4)这套策略落地没障碍:拿8月1日来说,优化后单元9657930100把原本散在39个词上的预算,收拢到其中ROI最高的11个重点词和2个黄金词,单词单日最高投入1847.60元;预期展位按单元上方位展现占比估(多数单元在20%~35%)。(5)为了验证,8月基线预期注册合计2161人,跟Sheet2同期实际注册2172人只差0.5%,可见归因和响应标定校得相当准。 2026年的投放要面对竞价、展现量、展现位、点击量、浏览量、注册量这六类不确定因素。我们分两层来建模。第一层,对点击率和转化率做贝叶斯后验估计:设关键词k的点击率先验CTRk ~ Beta(αk, βk),
有了观测数据(点击clickk、展现impk)后,后验就变成CTRk | data ~ Beta(αk + clickk, βk + impk − clickk);转化率依葫芦画瓢。共轭结构的好处是后验更新有解析解,小样本关键词的估计会自己往先验上靠。第二层,我们给日度波动做分布拟合:把2025年的日度序列取对数、减去7日滑动均值,
拿对数残差的标准差当作该单元该指标的日度波动率。各单元中位数估算下来:消费σ=0.788、点击σ=0.758、展现σ=0.673、CPCσ=0.224。看得出来,流量端(消费、点击、展现)日子里的起伏大且右偏、接近对数正态,而价格端(CPC)就温和得多——竞价的不确定,主要都集中在个别高峰日。
将各指标的不确定性建模为乘性对数正态冲击,并区分全市场公共冲击与单元个体冲击:
εu = exp( σu·Zu − σu²/2 ), Zu = √0.4·Zm + √0.6·Zi (13)
式里Zm是全市场的标准正态公共冲击(反映大盘流量和竞价的同向波动,方差占比取0.4),Zi是单元各自独立的冲击,前面的均值校正项−σ²/2是为了让E[ε]=1。我们以2025年9月11—17日各单元的实际消费作为2026年同期的日预算(总额23488元,不超过2025年投入),跑了2000次蒙特卡洛模拟:
每次抽样都给各单元的消费产能、点击转化和CPC加上冲击,再重新解一遍问题三的凸优化模型,把所有指标的抽样分布汇总起来,并用各词投入与产出的模拟均值当作期望投放策略。在此基础上,再拿条件风险价值当准则,检验一下策略够不够稳:
maxx CVaRη( Z(x, ξ) ), η = 0.1 (14)
也就是说,即便落到效益最差的那10%情景里,收益也还能站得住。结果很清楚:期望最优策略的CVaR明显好过随机策略和历史粗放策略,最坏情况下的效益也高出一截,抗竞价波动的本事更强。
表7给出2026年9月11—17日每日核心指标的期望值与
90%置信区间,图10给出点击量与注册量的区间带。逐日逐词的期望投放明细(共1803行,字段同result3)已保存至result4.xlsx。
表7 2026年9月11—17日逐日指标的期望值与90%置信区间
图10 2026年9月11—17日点击量与注册量预测(阴影为90%置信区间) 展现量和展现位的期望范围大致如下:9月11—14日日均展现量约6.2万~7.8万次(90%区间约[2.3万, 16.3万]),
上方位展现占比期望约0.36~0.38(90%区间[0.22, 0.51]);到了9月15—17日,因为2025年同期预算基数本来就低(日均才420~535元,像是阶段性强控盘),各项指标的期望水平跟着往下走,上方位占比期望约0.12~0.14。浏览量的期望值跟着点击量走,9月11日约19608次(90%区间[4176, 52530])。
结果分析:(1)7天算下来期望投入23234元、期望点击16800次、期望注册1619人、期望CPA约14.35元,这跟问题三优化完的成本水平对得上。(2)跟2025年9月11—14日同期实际(日均点击约2859次)摆在一起看,优化策略下的期望点击涨了约37.6%,说明在随机环境里这策略确实稳赚。(3)各指标90%置信区间都偏宽(点击量差不多跨一个数量级),这正是SEM日度流量高波动的本色,区间之所以这么宽,主要是点击率和转化率的乘性波动叠在了一起;其中CPC的90%上界能到4.56~5.08元,提醒我们真碰上竞价冲高的日子,得赶紧把预算往品牌词这类低CPC词上挪。(4)从结构看,预算向黄金词和高稳定性的重点词集中、问题词和无效词一分不投,这跟把不确定性考虑进去后“更趋保守”的理论预判相符。公司可以按区间上界预留预算,再拿期望值当考核基线。 我们对问题三模型三个关键参数做了灵敏度分析,结果列在表8。响应指数γ在[0.75, 0.95]里变的时候,16天的注册提升率落在+17.4%到+37.5%之间;扩容系数H在[2, 6]里变时,提升率在+15.1%到+29.3%之间;收缩系数K从[5000, ∞)一直到完全不收缩,提升率始终稳住+24.5%至+25.8%。三个参数在所有合理取值下优化收益都明显为正,而且γ、H越大(响应越接近线性、产能越松)收益越高,跟模型的经济学直觉是吻合的。
预算扰动这边,以2025年8月1—8日这段窗口为例,给单元预算加±10%、±20%的扰动再求解(图11):预算−20%、−10%、+10%、+20%时,
预期注册量相对基准分别是85.8%、94.4%、101.6%、105.3%。注册量对砍预算几乎是线性反应,可预算一加多就边际递减了(+20%预算才多换+5.3%的注册),这既印证了高效词流量供给有限,也说明模型最优解对预算设错并不敏感。分类阈值那头,换成一维K-means自适应阈值替代中位数阈值,分类一致率仍有66.0%,词类归属基本没乱。总的看,模型结论对参数选择是站得住的。
图11 预算扰动对优化结果的影响(2025年8月1—8日)
(1)体系完整、层层递进:搭出了“诊断评价(问题一)—价值分类(问题二)—组合优化(问题三)—随机预测(问题四)”的闭环框架。问题一摸出的规律(假日红利、无效词冗余、头部依赖)直接喂给了问题二的分类标准和问题三的优化方向,问题三模型本身又是问题四随机模拟的内核,几个问题的结论彼此都能对上。
(2)赋权客观、归因精巧:效益指数走的是对数变换加熵权TOPSIS,完全由数据自身的离散程度说了算,不必再为谁来拍板赋权争得面红耳赤;NNLS归因再接经验贝叶斯收缩,既守住了转化率的物理约束,又稳住了小样本单元的估计,8月基线预测跟实际注册只差0.5%,校准得相当扎实。
(3)求解精确高效:优化模型借着幂律响应的凹性,用边际收益相等的water-filling二分法拿到全局精确解,毫秒级就收敛、扩到几万关键词也不吃力,比遗传算法那类启发式方法靠谱;再用多重背包0-1整数规划(HiGHS分支定界)交叉验证,结论一致。
(4)不确定性处理务实:贝叶斯后验加上对数正态的“公共+个体”冲击假设,跟数据本身的形态贴得紧,蒙特卡洛模拟再配上CVaR准则,给出的期望范围能直接拿去预留预算、考核绩效——交出来的不只是一个点估计策略,还有用得上的风险边界。
(1)注册归因用的是当日点击的线性模型,没把广告点击到注册之间的滞后效应画进去(9月15—17日点击虽低、注册却还有250余人,就说明有滞后转化),低投放日的真实注册很可能会被算少;(2)响应函数参数γ、扩容系数H都是按行业经验定的,缺A/B实验数据来标定;统一一个注册转化率,等于无视了关键词之间的转化质量差别,部分高跳出率词的期望收益恐怕被高估了;(3)蒙特卡洛模拟默认各随机参数只通过公共冲击相关,可实际里竞价和展现量未必这么简单,协动结构可能更复杂,区间估计因此偏宽;关键词之间互相抢量(cannibalization)的效应,目前也只是靠单元预算约束间接兜着。
这套框架能直接挪到信息流广告(抖音、巨量引擎等)、电商直通车这类按效果计费的投放场景上:把关键词换成广告计划/素材,把搜索排名换成eCPM竞争位,同样的“熵权TOPSIS分类+响应函数优化+蒙特卡洛预测”流程照样走得通。再往前想一步:要是拿到关键词级的转化回传数据,就能用贝叶斯分层模型替换单元级归因,把小样本关键词的收益预测做精;响应函数也能扩成同时含出价和预算两个决策变量的广义二阶响应曲面;预算若要做跨期分配,静态优化可以升级成动态规划、模型预测控制(MPC)或在线凸优化,专门对付预算的时序调度;真接上实时竞价数据,还能引入强化学习,让投放策略在线学着动态更新。
[1] 邹佳君. 基于数据挖掘的SEM投放模型研究[D]. 上海: 华东师范大学, 2011.
[2] 吴英. 基于贝叶斯方法的网络广告预测模型研究[D]. 南宁: 广西大学, 2016.
[3] 马嘉懿. 基于影响力最大化的网络广告投放策略研究[D]. 北京: 北京化工大学, 2025.
[4] 高宁. 互联网计算广告投放效果预测及投放策略研究[D]. 北京: 对外经济贸易大学, 2022.
[5] 黄凯钒. 社交媒体广告投放智能策略研究[D]. 重庆: 重庆大学, 2024.
[6] 徐倩. 基于聚类算法的广告投放渠道效果分析[D]. 天津: 南开大学, 2021.
[7] 田武. 基于GRU神经网络的广告精准投放预测模型研究[D]. 2023.
[8] 欧鑫, 龚远强. 一体化系统资源调度算法研究与仿真[J]. 电子信息对抗技术, 2020, 35(6): 72-77.
[9] 黄梦帆. 基于大数据的广告投放策略研究[D]. 长沙: 湖南大学, 2018.
[10] 丁昭元. 在巨量引擎产品矩阵下电商广告精准投放策略研究[D]. 长春: 长春工业大学, 2021.
[11] 熊婷. 抖音剧情类短视频广告投放策略研究[D]. 烟台: 烟台大学, 2024.
[12] 李斐飞. 价值重构: 数字时代广告公司商业模式创新研究[D]. 武汉: 武汉大学, 2017.
[13] 姜启源, 谢金星, 叶俊. 数学模型(第五版)[M]. 北京: 高等教育出版社, 2018.
[14] 司守奎, 孙玺菁. 数学建模算法与应用(第三版)[M]. 北京: 国防工业出版社, 2021.
(1)数据预处理:用Pandas读Excel,Sheet1和Sheet2按日期做外连接,Sheet3里的“/”当作缺失处理,访问时长换成秒,再算出CTR、CPC、CPM、CPA、上方位占比这些派生指标;
(2)熵权TOPSIS分类:先做ln(1+x)对数变换,再极差归一化,接着算熵值和权重、正反理想解与贴近度得分,最后按中位数阈值做四象限分类,结果写进result2.xlsx;
(3)NNLS归因与收缩:用scipy.optimize.nnls估单元转化率,再按点击规模做加权经验贝叶斯收缩;
(4)凸优化求解:对乘子λ做二分搜索(water-filling),逐日逐单元拿到全局精确解,汇总后写进result3.xlsx;
(5)蒙特卡洛模拟:按对数正态的“公共+个体”冲击抽2000次样,每次都把凸优化重解一遍,统计各指标的期望和90%区间,再写进result4.xlsx。