記事書きました。クエリが英語でドキュメントが日本語のクロスリンガルタスクでどのembeddingモデルを選ぶと良さそうか、検索データセットのクエリを英訳して簡易評価してみた内容です。
最近の埋め込みモデルのクロスリンガル検索能力をチェックする|oshizo @_oshizo_
LLMに興味がありいろいろ実験して遊んでいます。自宅に3x3090環境。会社勤めのSE。推し🐰🍕🗼
Joined February 2020
- PDFMathTranslate使ってみてるのですが、こういう数式が本文に入ってる部分の翻訳がほぼ完璧。 pip installしてAPI_KEYとか設定するだけで動くし翻訳元言語と左右表示のPDFも一緒に出て嬉しい。 しっかり論文を読む頻度的に月額サービスは避けたかったので丁度良かった。 github.com/Byaidu/PDFMath…
- sbintuitions/sarashina-embedding-v1-1b、モデルカードのJMTEB評価を見ると特にRetrievalタスクがめっちゃ強くて良さそう。Max Tokens 8kも嬉しい。しかしライセンスはNCか。 e5-mistralとかと同じでLLMのlast token poolingを使ってるんですね huggingface.co/sbintuitions/s…
- 普段notionで作業メモを書いてるのでnote記事にする気が出なかったトピックをそのままnotionで公開できると良いかなと思ったのですが... やってみたところ、公開前提で書くと作業メモとしては使いづらいし、結局公開前に見直すコストがかかるのも記事と同じなので一回でやめるかも

