AI・機械学習

TruthfulQAとHaluEvalで暴くLLMの嘘!ハルシネーションと迷信トラップの測定法

「自信満々にスラスラと長文を答えてくれたので信じて本番の資料に使ったら、書いてある法律の条文や医療データが完全にデタラメだった…」—— LLM(大規模言語モデル)を業務で使っている人なら、誰もが一度は背筋を凍らせた経験があるはずです。これが...
AI活用

RAGASの4大指標と計算方法!社内文書QAの精度とハルシネーションを数値化する実践ガイド

「社内のマニュアルやNotion、PDF文書を検索して回答してくれる社内向けRAG(検索拡張生成)チャットボットを構築したものの、実際に全社公開してみたら『全く関係ない規則を引用して堂々と嘘をつく』『欲しい情報が全然返ってこない』とクレーム...
AI・機械学習

文章生成を捨てたAI「Jev」とは?System Oneモデルのアーキテクチャと工夫を技術的に解剖する

「LLMをプログラムの条件分岐やルーティングに組み込んでみたけれど、レスポンスが遅すぎてUXを損ねてしまう」「JSONモードを指定しているのに、稀にパースエラーや想定外のフォーマットが返ってきてパイプラインが止まってしまう」――AIを使った...
AI・機械学習

SWE-benchとは?GitHubのバグIssueをAIが自律解決できるか測る最前線

「AIコーディングのベンチマークで90%以上のスコアを出している最先端モデルを、自社のGitHubリポジトリに連れてきてバグ修正を任せてみたら、関連ファイルを1つも見つけられずに迷子になり、全く見当違いなパッチを出して沈黙した…」—— Cu...
AI・機械学習

HumanEvalとPass@kの計算方法!AIコーディング評価の不偏推定量を徹底解説

GitHub Copilot、Cursor、Claude Codeなど、日々のプログラミングでAIコード生成を使わない日はないというエンジニアが増えています。そうした中で、新しいLLMが発表されるたびにベンチマーク表のトップに登場するのが「...
釣り・アウトドア

【ハゼ釣り入門】時期・仕掛け・エサの選び方完全ガイド!アタリを倍増させる誘いの極意

秋風が心地よくなってくると、ふと水辺へ出かけたくなりませんか?初心者からベテランまで手軽に楽しめて、食べても最高に美味しいのが「ハゼ(マハゼ)釣り」です。子供の頃に竿を出した記憶がある方も多いかもしれませんが、実は大人が本気で突き詰めると非...
AI・機械学習

IFEval入門!文字数制限やJSON出力を自動テストする指示追従ベンチマーク

LLM(大規模言語モデル)を自社の業務システムやAPI連携に組み込んで開発していると、誰もが一度は頭を抱えるトラブルがあります。それが「プロンプトに『JSON形式のみで出力して』『500文字以内で要約して』とあれほど厳命したのに、余計な挨拶...
AI・機械学習

Chatbot ArenaのEloレーティング計算方法!ブラインド対戦でLLMの実力を数値化する数学的仕組み

新しいLLM(大規模言語モデル)が登場したとき、開発者コミュニティやX(旧Twitter)で真っ先に「ついに〇〇がChatbot Arenaで1位に躍り出た!」「GPT-4o超えを達成!」と大騒ぎになるのを目にしたことはないでしょうか?「そ...
AI・機械学習

MT-BenchとLLM-as-a-Judgeの仕組み!GPT-4による自動採点と3大バイアスの克服法

MT-BenchとLLM-as-a-Judgeの仕組みを解説!GPT-4等による自動採点のルーブリック設計や、2ターン対話による文脈追従力のテスト法、位置・冗長性・自己選好の3大バイアスを順序スワップで克服する実務手法を網羅。
AI・機械学習

GPQAとBBHの凄さ!最先端LLMの推論限界を暴く博士レベルベンチマーク

GPQAの仕組みや特徴、従来手法との決定的な違いを徹底解説。エンジニア目線での実装ポイントや注意点・アンチパターンまで具体例を交えて分かりやすくまとめました。