目次 LLMはこの知識を知っているのだろうか? というような疑問を持つことが多く、実際のこの点について研究している論文について読んでみました。 概要 この論文は、LLMの「マシンアンラーニング(machine unlearning)」が本当に安全で信頼できるかを検証し、隠れた知識の穴(hidden knowledge holes) を明らかにすることを目的としています。 1. 問題設定(何を解決しようとしているか) 背景:LLMは事前学習で大量の知識を吸収するが、その中には不適切・有害な知識も含まれる。 マシンアンラーニング:特定の知識だけを再学習なしで選択的に削除する技術として注目されている…