— Pratique / IA
De l’ingénierie IA, pas des démos d’IA.
N’importe qui peut brancher un robot conversationnel sur un modèle. Nous faisons l’ingénierie de ce qui vient après — récupération, évaluations, garde-fous, observabilité, et les systèmes qui gardent la fonctionnalité honnête en production.
— Pratique / Ce que nous livrons
Ce que nous livrons.
-
Du RAG en production.
Vectorize sur Cloudflare. Récupération hybride. Des stratégies de découpage ajustées au corpus réel, pas à un tutoriel.
-
Des systèmes d’agents.
Anthropic SDK et OpenAI SDK avec usage d’outils, appels de fonctions, et l’infrastructure sans éclat qui empêche un agent de tourner en boucle.
-
Des serveurs MCP.
Des serveurs Model Context Protocol sur Cloudflare Workers — pour Claude, Cursor ou tout autre client MCP.
-
Les évaluations comme habitude.
Si vous ne pouvez pas mesurer les régressions, vous n’avez pas un système d’IA — vous avez un prompt. Nous inscrivons les évaluations dans le pipeline de déploiement.
— Pratique / Ce que nous ne faisons pas
Ce que nous ne faisons pas.
-
Entraînement ou réglage fin de modèles.
Si votre problème exige vraiment des poids sur mesure, nous vous dirigerons vers des gens dont c’est le métier.
-
Des robots conversationnels plaqués.
Un widget de clavardage sur un site de marketing est rarement la bonne réponse. Nous concevons l’IA comme une fonctionnalité, pas comme un gadget d’interface.
-
« Générez donc le contenu. »
La génération de texte en volume marketing est bien servie par d’autres outils. Ce n’est pas un mandat d’ingénierie.
Stack — avec parti pris
Une boîte à outils plus petite, plus de profondeur.
Modèles
Anthropic Claude · OpenAI GPT · Cloudflare Workers AI
Récupération
Cloudflare Vectorize · D1 · hybride BM25
Orchestration
Anthropic SDK · OpenAI SDK · MCP · Workers
Observabilité
Workers Logs · Sentry · évaluations sur mesure
Prompts
Versionnés dans le code source · évalués en CI
Surface
API · agent · serveur MCP · interface intégrée
Notes de terrain — IA
Écrits récents sur la pratique.
-
12 août 2026
Structured output from language models: getting reliable JSON instead of prose
Free-text model output breaks pipelines. Here is how schema-constrained generation, tool calling, validation, and retries turn a language model into a component you can build on — and where the approach still fails.
-
22 juill. 2026
RAG evaluation: how to know your AI answers are actually correct
A retrieval system that sounds confident is not the same as one that is right. How to build an evaluation set, measure retrieval and faithfulness, run human spot-checks, and catch regressions before your users do.
-
11 juill. 2026
When Not to Use an LLM
A working checklist for keeping large language models out of the places they don't belong: deterministic logic, unverifiable outputs, high-stakes decisions, and problems a database query already solves.
-
10 juill. 2026
An AI-Readiness Checklist for Small Businesses
Eight checks that decide whether AI assistants can find, understand, and recommend your business — and whether your own operations are ready to use AI safely. No tools to buy; most items take an afternoon.
— Depuis le GitHub
Des modèles que nous livrons et maintenons.
Des patrons de production fonctionnels que nous utilisons nous-mêmes, sous licence MIT. Les deux se déploient dans votre propre compte Cloudflare en moins de cinq minutes. Des articles de blogue d’accompagnement expliquent l’architecture en entier.
-
Pipeline RAG de production sur Cloudflare Workers
-
Serveur MCP de production sur Cloudflare Workers
— Travailler avec nous
— Pour aller plus loin
Notes de terrain sur cette pratique
- MCP Servers in Production: When to Build, When to Skip Model Context Protocol is the best primitive Anthropic shipped in 2024 — and the most over-applied. A field guide to when an MCP server is the right answer, when it's overkill, and how to operate one in production on Cloudflare Workers.
- Structured output from language models: getting reliable JSON instead of prose Free-text model output breaks pipelines. Here is how schema-constrained generation, tool calling, validation, and retries turn a language model into a component you can build on — and where the approach still fails.
- RAG evaluation: how to know your AI answers are actually correct A retrieval system that sounds confident is not the same as one that is right. How to build an evaluation set, measure retrieval and faithfulness, run human spot-checks, and catch regressions before your users do.
- When Not to Use an LLM A working checklist for keeping large language models out of the places they don't belong: deterministic logic, unverifiable outputs, high-stakes decisions, and problems a database query already solves.
- Making Your Website Agent-Ready: What Actually Matters in 2026 AI agents and answer engines read your site before people do. What makes a site legible to them — structured data, markdown, an AI-crawler policy, and MCP.
- Workers AI vs OpenAI: A Cost-Quality Matrix at Low Volume Most production AI features default to OpenAI by reflex. They shouldn't. A real comparison of Workers AI, OpenAI, and Anthropic Claude across the four tasks that actually show up in client engagements — embeddings, generation, transcription, classification — with real numbers and a routing strategy that uses each for what it's good at.
- Production RAG on Cloudflare Without LangChain A 200-line RAG pipeline on Cloudflare Workers + Vectorize + D1 — the five primitives that matter, why frameworks rot at the wrong layer, and how to keep retrieval debuggable in production.
Vous travaillez sur quelque chose qui a des airs d’IA ? Parlez-nous-en.
Deux paragraphes suffisent. Nous répondons par écrit, fit ou pas fit, dans un jour ouvrable.