行业观点·Simon Willison
Simon Willison 分享新技巧:让 AI 先自由发挥再匹配标签
Simon Willison 提出一种为博客内容打标签的新方法,不再让模型从现有标签中选择,而是让模型自由生成候选标签,再用向量嵌入匹配到最接近的真实标签。他的博客有 1856 个标签,太多无法一次性交给模型处理。这个方法解决了大规模标签分类的难题,值得内容管理者和开发者一试。
Simon Willison 在自己的博客上分享了一个打标签的新思路。他的博客有 1856 个标签,数量太大,无法一次性丢给大语言模型,让它从这些标签里挑出匹配项。直接让模型在这样大的候选集里做分类,既不现实也容易出错。
Doug Turnbull 提出了一个解决办法:先不让模型看现有的标签词汇表,而是让它根据自己的理解,为内容凭空想象出一些可能合适的标签。然后把这些模型生成的标签,拿去和真实标签库里做向量相似度匹配。模型想象出来的标签是模糊的,但通过向量搜索,可以找到真实存在且意思最接近的那些标签。
Turnbull 的示例提示词里还提到,要在提示中给模型展示一些现有标签的格式范例,比如层级结构是「家具 / 客厅家具 / 咖啡桌」,这样模型生成的想象标签会更符合实际形态,匹配效果也更好。Simon Willison 认为这是一个巧妙的方法,打算用它来处理自己博客里那些一直没来得及加标签的旧内容。
#生成式AI#标签分类#技术技巧
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。