LLM做文本分类,通过看LLM<think></think>的推理过程,
发现,如果每个类目给了20-30个showcase列表,其实LLM最多只会利用其中1-5个showcase,其余showcase会忽略掉,
也发现,想指望LLM能从给的20-30个showcase中,像人类标注员一样自己(在脑中)提炼出泛化规则,LLM是不能的,
所以只能从类目的定义描述入手优化提示词。
这也是说,如果想写大量的showcase来实现自己所设想的LLM标注时的泛化效果,以修正数据中的指定的badcase,是不行的,或需要再结合其他方法尝试的。
但是也有一些方法可以更多的利用showcase,每个类目定义时,给了5个正例之后,可以给5个反例,实测LLM能更多利用多1倍的showcase。