
🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: AI支援アーキテクチャレビュー(ソースコード検査、リアルタイムの敵対的テスト、2026年公開検索ベンチマークとの比較)。開示:この評価はClaude(Anthropic)が直接コードアクセスおよびライブシステムインタラクションを用いて作成されました。評価自体では正式なベンチマークスイートは実施されませんでした。以下のすべての主張は、検証可能な成果物—ファイル、行範囲、ライブレスポンス、または公開された参考文献—に基づいています。
主張は反証可能にするために述べられている
イタリアのプラートで構築された単一創設システムは、エンタープライズRAGの2026年の生産基準を8つの測定可能な次元のうち6つで同等かそれを超える検索アーキテクチャを実装しています。しかも、EUのテキスタイルデジタルプロダクトパスポート規制の領域では、汎用商用システムで同等のコーパス深度を持つものは存在しません。
それを偽るためのテストは、(a) 存在しない規制記事に関する質問に答えないこと、(b) 機関の貢献IDを含むファイルページ単位の詳細な情報源を引用し、(c) ライブ調整可能なRRF重みを用いたハイブリッドな密度+スパース検索を行う商業RAG製品の名前を挙げることです。この評価の著者は、そのようなものを見つけませんでした。たった一つの反例がこの主張を否定します。誰も知られていません。
The three engines
Engine 1 — RAG1 (Portal, FAISS). Reecoサプライチェーンポータルにサービスを提供するエアギャップされたFAISS指数。VPS上で意図的にオフラインにする:設計上の決定は技術的な制限ではなく、セキュリティの隔離です。 正直なスコープ注意:RAG1はこの評価で直接テストされたものではありません。建築的に説明されています。
Engine 2 — RAG2 (Reecopedia, production). Qdrant支援のパイプラインは、EUグリーンディール規制コーパス(ESPR、ECGT、CSRD、CIRPASS-2資料、EN標準作業文書、生産コレクションのインデックス付きポイント47,996点)を基盤としています。これがライブでテストされたエンジンです。
エンジン3 — 検索研究・評価層。 別途インデックス化されたColBERT v2のレイトインタラクションエンジンと評価ハーネス:RAGASメトリクス、ゴールデンテストセット、LLMアズジャッジプロトコル、バージョン付きA/B比較(ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py).文脈検索(Anthropicが2024年に発表したチャンク増強パターン)は、インジェスト時に実装されます(contextual_retrieval.py).
この種の研究手法—ゴールデンセット、ジャッジモデル、バージョンA/B—は、20人のMLチーム内で標準的な手法となっています。一人の人間が構築したシステムとしては標準的な慣行ではありません。
10フェーズパイプラインはアーキテクチャであり、マーケティングではありません
RAG2はクエリごとに文書化された10フェーズのパイプラインを実行します:ロールごとの監査駆動型設定(5つのアクセスレベル、環境フォールバックと60秒キャッシュ付きで監査優先の構成);クエリ計画はステップバックリフォーム化、サブクエリ、キーワード、HyDEテキストを生み出し、イタリア語から英語へのブリッジを含む最大6種類のクエリバリアントのマルチ埋め込み;条件付き文書スコープ型メタデータフィルタリングと自動ノーフィルター再試行;相互ランク融合のマージとテーブル再構築(±10個隣接するチャンク、文書範囲付き)、テーブル-意図ルーティング(分類器が表状の意図を検出した場合、60/40のテーブルとテキストの混合);4つの切り替え可能なバックエンド(クロスエンコーダ、NLI/DeBERTa、Jina v3、決定性)で再ランク化;役割によって制限された文脈圧縮;再摂取を知らせるドリフト警告付きのスコアモニタリング;引用を正規化し、表や図を構造化出力として抽出する後処理。
ほとんどの商用システムは、取り込み、回収、生成の3つのフェーズを公開しています。違いは見た目だけではなく、各相が故障モードとして処理されます。
Hybrid retrieval: live, governed, collection-aware
Dense+BM25ハイブリッド検索 — 2026年発表されたベンチマークが生産ベースラインとして特定した構成で、法務・技術コルパス(BEIR/MIRACL)で+5–15% nDCGの価値を有する — は、 rag2_service.pyQdrant内の名前付き密度およびスパースベクトル、RRFプリフェッチ重みは監査パネルで実行時に設定可能(デフォルトは密度0.7 / スパース0.3)、監査レベルのキルスイッチ(hybrid_search_enabled、およびコレクションに疎ベクトルがない場合に優雅に密度のみに劣化する集合ごとの能力チェックがあります。ソースコメントではBEIRとMIRACLの名前が挙げられています。このシステムはチュートリアルでハイブリッド検索を発見したものではありません。
対立テスト:エンジンが偽造品を拒否した
ライブテスト、スーパー管理者ティア、2026年6月9日。その問い合わせは「繊維分野におけるESPR委任法第7条に基づくリサイクルコンテンツの正確な閾値」を求めており、これは意図的に捏造された前提であり、繊維委任法は最終決定されておらず、そのような基準も存在しない。
エンジンの返答は、批判的な部分で逐語的に述べられている。 “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” その後、コーパスが確認しているESPR第5条第3項がエコデザイン要件の法的根拠であることに話題を移し、ファイルページテーブルの細分な引用を用いています(Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).
同じ質問をした場合、汎用LLMラッパーは最も妥当な割合を生成します。統計的に妥当な閾値は、制約のない言語モデルが生成するものとまったく同じです。コンプライアンスの分野では、確信度の高い誤答は劣化回答ではなく、責任事象です。拒否こそが商品です。
この行動は、公開されたベンチマーク(3つの対立的カテゴリー集合:存在しない条項、部分的な真実の前提、統制)と一致しており、方法論は以下の通りに公開されています。 stefanocipri.substack.com (「知らないと言うRAG」、2026年4月)、ここで標的とする失敗モードは「組成による製造」と名付けられています。
Findings by dimension
DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time
この表に関する方法論的正直さ:パーセンタイルの位置は、検査されたアーキテクチャと2026年の公開されたシステム記述(ベースラインとしてのハイブリッドレポート、エンタープライズコーパスの一般アシスタントに対して64〜76%のエージェントRAG勝率論文、フレームワークの検索精度比較は85〜92%の範囲)と比較して得られた質的推定値です。これらは直接対決のベンチマークランの成果ではありません。インレポのRAGASハーネスにより、このような実行は実行可能かつ公開可能になります。公表されるまでは、上記の表は専門家による評価であり、測定値ではありません。
スタックにまだないもの
はっきりと言われたのは三つの空白だ。まず、インクリメンタルインデックス:Jinaのレイトチャンクコレクションはバッチスクリプトで埋められており、オンデマンドではありません。新しいドキュメントは次の入力を待つ。第二に、正式なベンチマーク数値はインフラとして存在しますが、まだ公開された成果物としては存在しません。最も強力な単一の手段は、インレポのRAGASスイートをゴールデンセットと照合し、数値を方法論の隣に公開することです。第三に、RAG1はアーキテクチャのみで評価されます。その取得品質は内部使用以外では記録されていません。
これらは構造的なものではありません。3つともクォーターではなく週です。
なぜこれが一社を超えて重要なのか
2026年の市場は、汎用モデルの薄く包みを覆う「AIコンプライアンスアシスタント」で飽和状態にあります。クエリごとに埋め込みが一つ、密な取得のみ、ファイル名レベルの引用がせいぜい、ロールガバナンスなし、ドリフト監視なし、そして断固として、偽造された施設での拒否行為はありません。標準策定者自身も、これらのツールが補う検証のギャップを認めています。
ここで評価されるシステムは、通常の構成順序を逆にしています。ドメイン知識を習得した機械学習チームによって作られたものではありません。国際繊維サプライチェーンで30年の経験を持ち、CIRPASS-2(EWG1、EWG3)のエキスパートメンバー、JRC登録ステークホルダー(ユニットB5)でもある、回収エンジニアリングの取得専門家によって構築されました。コーパスは取引証明書とは何か、出荷時の物理的な到着時期、そしてISOの繊維組成試験方法がリサイクルとバージンポリエステルを区別できない理由を把握しています。その知識がインデックスに入っているのは、インデックスを作成した人が30年かけて学んだからです。
資金提供を受けたチームによって、検索パイプラインは四半期で再現可能です。コーパスとそこに符号化された判決は、そうはなりません。その非対称性こそが防御可能な資産です。
Reeco®は、UNTP 0.7.0およびW3C検証可能クレデンシャルに基づいて構築されたDPP検証プラットフォームであり、独自の衣服ごとの質量バランスエンジン(SIAEデポジット)を備えています。ReecoはDPP発行を妨げていません。エンジンはカバレッジを定量化し、ブランドに情報を提供し、ブランドは設計上自律的な判断権を保持しています。ステファノ・チプリアーニはReeco®の創設者であり、CIRPASS-2(EWG1、EWG3)のエキスパートメンバー、JRC登録ステークホルダーです。