※本記事は2026年9月16日に米国で公開されたWhy We Post-Trained Our Own Reasoning Modelの翻訳です。本記事の正式言語は英語であり、その内容および解釈については英語が優先されます。
Agentforceのこれまでの歩みの大半において、意図の検出、プロンプトインジェクションの検知、有害性の判定、評価、リランキングなど、ほぼすべてのタスクの推論をひとつの汎用モデルが担っていました。過去18か月間で私たちはその体制を見直し、それぞれ特定の業務向けに構築された、より小型のモデル群を開発してきました。しかし、中核となる複数ステップの推論部分については、依然として汎用モデルに委ねていました。
今、それが変わります。Koaの登場です。Salesforceの信頼境界(Trust Boundary)内で稼働する、エンタープライズ業務に最適化された初のAI推論モデルです。私たちはNVIDIAと共同でKoaを開発し、同社のNVIDIA Nemotron 3 Superモデルを、最も汎用的に利用できるエンタープライズ業務向けにポストトレーニングしました。お客様は今、Koaを使ってAIエージェントのプロセスを実行できます。
エンタープライズ業務のための推論モデル
推論とは、エージェントが複雑な問題を考え抜き、自らのロジックを評価し、どのツールを呼び出すべきかを判断し、回答やアクションを実行する前にその道筋を検証するプロセスです。フロンティアモデルはこれを高い水準で行いますが、返金ポリシー、物理的な問題、カスタマージャーニーのいずれについても同じ汎用的な知能を用いて、それぞれを第一原理から考え抜いてしまいます。この汎用性こそが汎用モデルの強みであり、同時にその限界でもあります。フロンティアモデルはお客様のビジネスについて外部からの視点で推論しています。つまり、その業務を実際に経験したことがないので、広範な知識を当てはめているにすぎません。
人がある仕事に習熟していく過程を考えてみてください。新入社員はオンボーディングを通じて、方針や手順、与信の閾値やコンプライアンス上の境界線、そして会社が見込客をどのように選別し、返金をどのように処理するかといった具体的なやり方を学びます。そして、そのような業務を十分な回数繰り返すことで新入社員は業務のやり方を完全に身につけ、学んだことを実践に適用していきます。それこそが専門性です。すなわち、業務の中で学び取った一連のルールと苦労して得た実践知を、一貫性を持って適用すること、です。
しかし、汎用モデルは常に第一原理から出発してしまいます。すでに1000回行ったことのあるタスクであっても、そのたびにゼロから考えるのです。また、AIはその仕組み上、確率的に推論するため、出力結果が毎回同じやり方になるとは限りません。これは創造性が求められるタスクには適していますが、業務に必要なガバナンス(統制)の取れた再現性の高さを求める環境なため、実行すべき業務そのものを学習し、その専門性を常に活用できるモデルの方が適しています。
それこそが、私たちが目指して構築したモデルです。
構築の方法
推論モデルをゼロからトレーニングするには、膨大なデータと時間が必要です。幸いなことに、私たちはその必要がありませんでした。NVIDIAは既に、1200億パラメータのオープンモデルであるNemotron 3 Superを構築しており、これはクローズドなフロンティアモデルには決して得られない2つのものを私たちに与えてくれました。1つ目は重みへの直接アクセスです。これにより、私たちはこのモデルをポストトレーニングし、実行したい業務そのものに適応させることができました。2つ目は出自の透明性です。NVIDIAはNemotronのトレーニングに使用したデータセットを公開しており、ベンダーの言葉をそのまま信じるのではなく、その基盤に何が使われているかを自ら確認することができました。これによりお客様には、私たち自身が管理・検証できる、オープンで米国でトレーニングされたモデルという、ブラックボックスではない信頼できる基盤が提供されます。
モデルに業務を教える方法には2つあります。1つ目は、成功した業務の記録を模倣させる方法で、業界標準である教師ありファインチューニングです。これは、ハンドブックによるオンボーディングのようなもので、物事がどのように行われるかを読んで記憶するというやり方です。しかし、このアプローチでは得られる成果に限界がありました。エンタープライズ向けのエージェントは複数ターンにわたるツール利用型のワークフローを実行するため、それについて読むだけで学習するには複雑すぎるのです。
そこで私たちは代わりに、モデルに実際の業務を行わせることにしました。私たちのチームは、製造業、金融サービス、医療、旅行など14以上の業界にわたるシミュレーション上のエンタープライズワークフローを構築しました。協力的な顧客もいれば、イライラした顧客もいるなど、さまざまな感情や人格を持つ合成顧客を生成しました。ツールはエージェントの呼び出しに応答し、評価者(ジャッジ)が顧客の問題が実際に解決されたかどうかを採点しました。解決されなかった場合、モデルは再度挑戦し、各シナリオを何千回も実行してスコアの改善を試みました。この強化学習のアプローチにより、最も重要な能力、すなわち複数ターンにわたるツール利用の能力が向上しました。つまり多くのステップ、ツール、そして会話のターンをまたいでタスクを遂行する能力です。
これを実現するために、私たちが27年間運用してきたCRMの経験をモデルに学ばせたいワークフローそのものとして活用しました。サービスのエスカレーションが内部でどのように見えるか、見込客の選別に実際に何が関わるか、顧客が電話の向こうにいるときに「解決」が何を意味するか、私たちはそれを知っています。この知識は汎用モデルが決して持ち得なかったものであり、まさに私たちがKoaに与えることができたものです。
あるシナリオについては特に触れておく価値があります。それは、企業が最も懸念しているシナリオだからです。私たちのシミュレーションでは、あえてモデルを、適切なツールが用意されていない状況、つまり顧客がエージェントにとって現在できないことを求めてくる状況に置いたのです。こうした状況では、汎用モデルは応答をごまかす傾向があります。似たような名前のツールを呼び出して変更すべきでないデータを変更してしまったり、さらに悪い場合には、実際には行われていないアクションを完了したと報告したりしてしまうこともあります。私たちはKoaに、優れた従業員がとるべき対応を学習させました。いったん止まり、顧客に対してまだできないことを正直に伝え、必要な情報を求め、その場でタスクを再開する、あるいはモデル単独で判断すべきでない状況では人間のチームメンバーに引き継ぐ、という対応です。何をしないべきかを知っていることも(あるいは知らないということを知ることも)、エンタープライズ業務遂行における専門性の一部です。
エージェントが日々行っている業務の例として、新規見込客の選別を取り上げます。この業務は決して自由度の高いものではありません。各企業には、選別済みの見込客の定義付け、アカウントの履歴や企業属性データと照合する手順、営業へのルーティングの閾値、基準を満たさない場合のルールなどが存在します。汎用モデルはこれらのルールや定義を外側から推論するため、毎回わずかに異なる結論に至る可能性があります。一方、その業務を学習したモデルは、1件目と同じ定義を100件目の見込客にも適用します。これが、選別業務について一般的に賢いモデルと、お客様のビジネスのやり方に沿って見込客を選別できるモデルとの違いとなります。
Koaは単独で機能するわけではありません。Salesforce EngineeringおよびAI Researchが開発した、ドメイン特化型モデル群を基盤としており、その中には HyperClassifier、TextEval、そして最近発表されたMoiraiが含まれます。これらの専用モデルをフロンティアLLMと組み合わせてオーケストレーションすることで、意図分類、有害性判定、検索のリランキングといった特定のタスクは、それぞれのために構築されたモデルへとルーティングされる一方、Koaは複数ステップにわたるエンタープライズ推論を担います。
現時点で見えている成果
Koaは既にSalesforce社内の従業員向けワークフローで稼働しています。現在は、サービス、セールス、コマース領域でエージェントを運用する少数のお客様との顧客パイロットへと移行を進めています。商談の更新、ケースのルーティング、フォローアップのスケジューリングといったCRM特有のタスクに関する初期のベンチマーク結果は良好で、最も強力な汎用モデルを上回る性能を示しています。
お客様のものであり続ける部分
Koaにはもう一つの利点があります。Koaは完全にSalesforceの信頼境界(Trust Boundary)内、すなわち私たちが運用するインフラストラクチャ上で稼働します。お客様のデータがお客様の管理下から外れることは一切ありません。Koaに学習させるために使用したシミュレーション業務は、いずれも実際の顧客データを一切使用していません。サービスデスクのデータも、合成した顧客のデータも、採点済みの解決結果のデータも使っていません。私たちにはそれが必要なかったのです。これらのプロセスを27年間運用してきた経験こそが、そもそもどのようにシミュレーションを構築すべきかを教えてくれました。
お客様のデータを保護することは、Koaの構築方法の中核をなす考え方でした。それは稼働方法においても同様に重要です。お客様のデータやトレース(実行記録)は、モデルの学習に一切使用されません。お客様のエージェントがビジネスをどのように推論しているかの記録、つまり会社の実際の業務パターンが積み重なったものこそ、競合他社が決して模倣できない優位性です。レンタルのフロンティアモデルで推論を行う場合、そのトレースはモデルを改善するための燃料となってしまいます。一方、Koaで推論を行う場合、お客様のデータとトレースはお客様のものであり続けます。
詳細情報:
目の前のビジネスの業務に適した知能と、それを自ら決定できる統制力。金融サービス、医療、旅行、会計といった規制の厳しい業界のパイロットのお客様は既に、エンタープライズ業務向けに最適化されたモデルの上でエージェントを稼働させるという選択をしています。Koaの詳細については、こちらをご覧ください。
本記事、または公式に言及されている未提供のサービスや機能は現在利用できないものであり、予定通りに、または全く提供されない可能性があります。お客様は、現在利用可能な機能に基づいて購入をご判断くださいますようお願いいたします。







