Claudeの業務での使い方|合計は合いましたが要約で出典が消えました
24行の売上表をAIに読ませて集計させ、その答えをPythonで独立に検算しました。合計は合っています。ただし「一番多い分類は?」と聞くと、件数で数えるか金額で数えるかで答えが入れ替わりました。長い資料の要約では、数字は残ったのに「その数字が誰の記載か」という限定だけが落ちました。実行結果と検算の手順をそのまま載せています。

この記事でわかること
- 24行の表を読ませた集計は、Pythonでの検算と1円も違わなかった(東京支店の消耗品 217,800円・9件)。問題は「合っているかどうかが、表を見ても分からない」ことなので、検算の手順を先に決めておく
- 「一番多い分類は?」は答えが2つある。実測では件数なら消耗品(9件)、金額なら外注費(274,320円)で1位が入れ替わった。集計軸を書かない質問は、AIが勝手に決める
- 検算はこの2つで足りる——①件数も一緒に出させる ②分類別の内訳を出させて総合計と突き合わせる(実測 274,320+217,800+39,460=531,580円で一致)
- 長い資料の要約で落ちたのは数字ではなく「限定」だった。「4,500円/月」は残ったのに「大塚商会の公式サイトの記載」という但し書きだけが消えた
AIに表を読ませて集計させたら間違えるだろう、と思っていました。24行で試したところ、Pythonで独立に計算した答えと1円も違いませんでした。
問題はそこではありません。合っているかどうかが、表を見ても分からないことのほうです。そして「一番多い分類は?」と聞いた瞬間に、答えが2つに割れました。以下は架空の売上表で実際に流した記録です(実行環境はClaudeですが、手順はツールに依存しません)。
Claudeの業務での使い方は、表の読み取りと長い資料の要約で分かれる
- 表の読み取り……行数が多くなければ集計も内訳も出せます。確かめ方を決めておけば使えます
- 長い資料の要約……量は入りますが、入る量と精度が保たれる量は別です
Anthropicの公式ドキュメントは、後者についてこう書いています。
As token count grows, accuracy and recall degrade, a phenomenon known as context rot. (トークン数が増えるにつれて、精度と再現率が低下する。context rot と呼ばれる現象である)
「1Mトークン入るから1M入れてよい」ではない、と公式が明言しているということです。
渡す前に決めること
表には、たいていそのまま外に出せない情報が入っています。取引先の社名、単価、担当者名。「入れてよい情報/だめな情報」を先に決めないと、判断が毎回その人の感覚になります。決め方は生成AIの社内ルールの作り方に書きました。決まっていない会社は、社名を伏せ字にして金額を丸めてから渡す運用にしておけば事故は起きません。この記事の表も架空のデータです。
実験1 表を読ませて集計させる
渡したのは、日時・支店・分類・数量・単価の5列で24行の表です(金額の列は無いので、掛け算から先にやらせます)。
2026-09-01 17:45 | 東京支店 | 消耗品 | 50 | 1200
2026-09-02 13:15 | 大阪支店 | 外注費 | 50 | 2400
2026-09-04 11:00 | 名古屋支店 | 備品 | 50 | 320
(…全24行)
聞いたのは1行だけです。
この表から、東京支店の消耗品の合計金額を出してください。
出てきた答えは 217,800円・9件。 同じデータをPythonで独立に計算しても 217,800円・9件でした。一致しています。
ここで止めると次が決まりません。合っていることを表から目視で確かめられないからです。24行なら数えられますが、200行では無理です。
実験2 「一番多い分類は?」と聞くと、答えが入れ替わる
同じ表に、集計軸を書かずに聞きました。
この表で、一番多いのはどの分類ですか。
実測した答えは2通りに割れます。
| 数え方 | 1位 | 実測値 |
|---|---|---|
| 件数で数える | 消耗品 | 9件 |
| 金額で数える | 外注費 | 274,320円 |
どちらも間違いではありません。質問文に集計軸が無いので、AIがどちらかに決めているだけです。しかも決めた根拠は答えに書かれません。「一番多い」「主力の」「メインの」は全部この穴を持っているので、最初から「金額の合計が一番大きい分類」と書きます。
検算はこの2つで足りる
表の集計をAIにやらせるときに、当社が毎回入れているのは次の2つです。
- 件数も一緒に出させる……合計だけでは拾い漏れも二重計上も見えません
- 分類別の内訳を出させて、総合計と突き合わせる……一致しなければどこかで数え落としています
実測するとこうなりました。
| 分類 | 金額 | 件数 |
|---|---|---|
| 外注費 | 274,320円 | 8件 |
| 消耗品 | 217,800円 | 9件 |
| 備品 | 39,460円 | 7件 |
| 合計 | 531,580円 | 24件 |
274,320+217,800+39,460=531,580円。8+9+7=24件で渡した行数と一致します。1行ずつ見なくても、ここが合っていれば拾い方は合っていると言えます。この2つを質問文に最初から入れておけば、検算は数十秒です。
実験3 長い資料を要約させると、何が落ちるか
9,220字の記事(当社が同じ日に書いた比較記事)を渡して、5行で要約させました。
数字は全部残りました。「7社中2社」「価格の公開は3社」「4,500円/月(税別)」。落ちたのはそこではありません。
落ちたのは「4,500円/月は大塚商会の公式サイトの記載であって、マイクロソフトの公式価格ではない」という限定でした。要約の中では「Copilotは4,500円/月(税別)」という、主語が1段広い文になっていました。
数字は目立つので残り、但し書きは目立たないので消えます。 但し書きの消えた文は、引用された時点で事実の誤りになります。対策は「限定を落とさないで」と頼むことではなく、出力の形に枠を作ることです。
次の2つに分けて要約してください。
1. 事実(数字を含む)
2. その事実に付いている限定(誰の記載か/いつ時点か/対象は何か)
2番の枠があると、限定は「どこに書けばいいか分からない情報」ではなくなります。議事録の記事で「未確定・要確認」を独立した見出しにしたのと同じ理屈です。
この作業をAIに任せてよい範囲(当社の判定)
| 作業 | AIに任せてよいか | 人が確認する場所 |
|---|---|---|
| 表の構造を読む(列が何か) | ◯ 任せてよい | — |
| 数十行の集計 | △ 下書きまで | 件数と内訳の合計が総合計と一致するか |
| 数百行以上の集計 | × 任せない | 表計算ソフトかスクリプトで計算する。AIには読み取りと説明をさせる |
| 「一番多い」など軸が曖昧な質問 | × 任せない | 質問文の側を直す。答えを疑うより早い |
| 長い資料の要約 | ◯ 任せてよい | 数字ではなく、限定(誰の記載か)が残っているか |
| 社外に出す文書の最終確認 | × 任せない | 必ず人が読む |
分かれ目は「間違っていたときに気づけるか」です。 集計は間違っていても答えがもっともらしい形で出るので、答えを見て判断できません。 だから判断する場所を答えの外——件数と内訳——に作ります。
自社で回すのが大変なとき
毎月同じ集計を誰かが手で貼り付けている状態なら、それは使い方ではなく仕組みの問題です。頼む先を比べるならChatGPT導入支援の会社おすすめ8選とCopilot導入支援の会社おすすめ7選にまとめました。「導入支援」という同じ言葉が、ライセンス・研修・定着・開発の4つの別商品を指しているので、自社に空いている穴を先に見てください。
手順の前に、自社がどこで詰まっているかを見ておく
集計は入口としては良いのですが、そこが一番時間を食っている作業とは限りません。
AI適合度診断は10問の選択式で、その場で点数が出ます。連絡先の入力は要りません。 作りたい仕組みが決まっているなら、AI概算見積もり(無料・約3分)でSIer相場との比較つきの金額を先に見ておくほうが早いです。
出典
- Context windows|Anthropic 公式ドキュメント(2026年9月12日閲覧。context rot の記述、コンテキストウィンドウは最大1Mトークン、入力だけで超えると 400
invalid_request_error) - 生成AIの社内ルールの作り方(当社記事)
- ChatGPTで議事録を作る手順(当社記事)
- 本文の表・入力例・出力例は当社が架空データで実行したものです(実行日 2026年9月12日・実行環境 Claude)。集計の答えは Python で独立に計算して突き合わせました。いずれも1回ずつの実行結果で、複数回試した平均ではありません
よくある質問
- どの生成AIでも同じ手順で使えますか?
- 使えます。この記事の手順はツールに依存しません。やっていることは「集計軸を質問文で定義する」「件数と内訳も一緒に出させる」「別の方法で検算する」の3つだけなので、ChatGPT・Geminiなど他の生成AIでも同じように動きます。この記事の実行例は、当社が普段使っている環境(Claude)で実際に流したものです。
- AIに計算をさせても大丈夫ですか?
- 読み取りと計算は分けて考えてください。この記事の実測では24行の集計が完全に一致しましたが、合っていることを表から目視で確かめるのは現実的ではありません。だから「AIを信じるかどうか」ではなく、内訳と総合計を突き合わせる手順を毎回踏むという設計にします。行数が多い表は、表計算ソフトかスクリプトで計算させて、AIには読み取りと説明をさせるほうが安全です。
- 「一番多い」と聞くと何が起きますか?
- 実測では、件数で数えるか金額で数えるかで1位が入れ替わりました(件数なら消耗品9件、金額なら外注費274,320円)。どちらも間違いではありません。質問文に集計軸が書かれていないので、AIがどちらかに決めているだけです。「金額の合計が一番大きい分類」のように、最初から軸を書いてください。
- 長い資料を渡すと精度は落ちますか?
- Anthropicの公式ドキュメントには「トークン数が増えるにつれて精度と再現率が低下する(context rot と呼ばれる現象)」と明記されています。入れられる量と、入れて精度が保たれる量は別ということです。分割して渡す、関係のない部分を先に落とす、といった手当てが要ります。
- 社内の実データをそのまま貼ってもいいですか?
- 先に社内のルールを決めてからにしてください。どの情報をどのツールに入れてよいかは、契約しているプランやデータの扱いによって変わります。決め方は「生成AIの社内ルールの作り方」の記事に書きました。決まっていないうちは、社名を伏せ字にして金額を丸めてから渡す運用が無難です。この記事の例も架空のデータです。
自社の場合、いくら?
作りたいものを入力するだけで、AIが約3分で概算見積もりを作成します。一般的なSIer相場との比較つき、無料・営業からのしつこい連絡はありません。
AIで概算見積もり(無料) →先に費用の目安を知りたい方は用途別の費用相場へ。