AIラジオ
- Codexに作業させている間は動画見ながらFGOの周回したりしてるんだけど、動画見るのも飽きてきたし、動画はどうしても目が持っていかれる。
- ということでLLMとTTS使ってラジオができないか?ということで作り始めた。
- 各種ニュースサイトとかのRSSフィードから記事を取得。記事内容とランダムに選択したローカルのMP3音源データを元にしてラジオのナビゲーター2人の台本をLLMで作成。それをTTSに読み上げさせる。読み上げ終了後に音源を再生。曲を再生している間に次の台本データと読み上げ音声を生成してループという感じ。
- 曲の再生中に音声を生成するため最初の再生開始に若干時間がかかるもののそれ以降はスムーズ。
- Codexで作業中の場合は、承認を求められたり作業が完了した時には音楽再生とかを中断して速報的に報告が入るようにもした。
- ナビゲーター二人の設定プロンプト画面とか、Irodori-TTSの読み方がブレたりそもそも読めない単語の読み方を登録する辞書機能など、基本機能は実装できた。日常用途では困らないからもう完成でもいいかなと思ってる。
- 思いついてから今に至るまで作業時間は実質2日ほど。
日本語ベンチマークが欲しい
- 自分で作ってるロールプレイチャットのシステムに合っているモデルの選定のためのベンチマークツールが欲しい。次に作るのはこれかな。
- 単純な日本語の堪能さと、キャラクターを演じてそれを維持し続けられるかどうかというのは別に感じるんだよね。
- 今のところ私が手動で試して何となくでいい悪いを判断しているから、定量的に同じ条件で判断できるようにしたい。
- ただ、審判役のLLMが高性能じゃないとそもそも意味ないから、ベンチーマークシステムの出力をChatGPTあたりに渡して判断させる方式にしたい。従量課金は避けたいからAPI連携はなしかな。