与推荐问题相似,提升点击率、转化率在内的通用指标,同时兼顾阅读体验。
如何量化阅读体验?
对一条内容生成标题。
指推荐文案与内容化聚合页。
推荐文案:一个商家的核心卖点描述,一句话推荐。
内容聚合:标题+多条文案的短篇推荐理由。
理论!=实际
理论:基于数据衡量与训练目标样本的相似度。实际:以线上效果为导向,辅以人工评测。为了让终端可以完成更多任务:分类、序列生成、语义推理、相似度匹配。
Contextual Embedding
解决的核心问题:如何利用大量的没标注的文本数据学到一个预训练的模型,并通过通过这个模型辅助在不同的有标注任务上更好地完成目标。模型:Elmo, GPT, BERT.Tree-Based Embedding
用根结点的Embedding即可作为上下文的表征调优难度大,未使用。【商户评论+商户属性】 & 【商户信息 + 卖点信息】 & 【卖点图谱】
中间的【商户信息+卖点信息】是目标文本。 前期可以通过LDA等方法进行卖点挖掘。
其实是一个受限优化问题:解码端的强控制+弱控制;动态加入所需的控制目标。
将地域、品牌等涉及到强控制的卖点和实体直接编码进入context;基于卖点共现概率随机加入context
风格也作为特征写入context
本质原因是,在解码预测Beam Search时永远选择概率最大的序列,并不考虑多样性。但是如果预测时采用Decoder概率Random Search的方法,则在通顺度上会存在比较大的问题。
直接对全局结果进行优化,在预测时把一个聚合页Context放到同一个batch中,batch_size即为文案条数,对已经生成序列上进行实体重复检测和n-gram重复检测,将检测判重的加一个惩罚性打分。
