Ingénieur IA indépendant — Casablanca, sur le fuseau de Paris

Je construis des systèmes RAG qui tiennent sur de vrais documents.

La plupart des démos marchent sur des PDF propres. En production, les documents sont scannés, font des centaines de pages, mélangent le français et l’arabe, et engagent juridiquement. J’ai déjà résolu ce problème une fois, à l’échelle : 45 000 documents, 274 000 citations de provenance, chaque valeur extraite rattachée au passage qui l’a produite.

Projets à partir de 8 000 € · TJM 500 € · disponible immédiatement


Pourquoi les systèmes RAG cassent en production

Les documents réels sont sales

Scans, photocopies de scans, tableaux qui n’existent qu’en image, structure qui change d’un émetteur à l’autre. Le pipeline qui marche sur vos dix PDF de test ne survit pas au onzième.

Le vectoriel seul ne discrimine pas

Dans un corpus juridique ou réglementaire, les formulations se répètent. Deux passages qui disent l’inverse ont des embeddings presque identiques — et ce que l’utilisateur cherche vraiment, un numéro d’article, une référence, une date, un montant, est précisément ce que les embeddings gèrent le plus mal.

Sans citation, le système est inutilisable

Dès que l’enjeu est contractuel, une réponse invérifiable ne vaut rien. Et la traçabilité ne s’ajoute pas à la fin : elle se perd au découpage. Il faut la transporter depuis l’OCR jusqu’à l’écran.


Comment on travaille ensemble

Audit et cadrage

Quelques jours pour établir pourquoi votre recherche échoue, ce qui est réparable, et ce que ça coûte. Vous repartez avec un plan chiffré — que vous me confiiez la suite ou non.

Construction en production

Conception et mise en production du système complet : ingestion, recherche, citations, interface. Livré avec un jeu d’évaluation qui vous appartient, pour que vous puissiez juger la qualité sans moi.

Accompagnement

Un à deux jours par mois pour faire évoluer un système existant, arbitrer les choix techniques et transmettre à votre équipe.

Projets à partir de 8 000 € · TJM 500 € · disponible immédiatement


Secteurs

Le problème est le même partout : beaucoup de texte, peu de structure, et un enjeu qui interdit l’à-peu-près.

  • Legal-tech — contrats, extraction de clauses, dossiers
  • Assurance — sinistres, comparaison de garanties
  • Santé et administration — dossiers, codage, conformité
  • Documentation technique — manuels, normes, spécifications
  • Finance — rapports, dépôts réglementaires, due diligence

Un corpus qui résiste ?

Décrivez vos documents en trois lignes — volume, format, ce que vous cherchez dedans. Je vous dis en trente minutes si c’est faisable, comment, et à quel prix.