Skip to content

Cote d'Ivoire

ocds-bidanga-CI-OP00458564

Closedtender

Hiring a firm for a pilot project of localized language model (LLM)

Original title: Recrutement d'un cabinet pour la mise en œuvre d'un projet pilote de modèle de langage (LLM) en langues locales

Deadline

July 23, 2026

Closed
Published on July 23, 2026 at 12:00 AMModified on July 25, 2026 at 01:03 AM

Key information

Type
Construction
Location
Cote d'Ivoire
Deadline
July 23, 2026 at 12:00 AMClosed
Estimated Value
Not disclosed
Language of Notice
English

What is this tender about?

Hiring a firm for a pilot project of localized language model (LLM) is a construction procurement opportunity published by Ministry of Digital Transition and Technological Innovation in Cote d'Ivoire on July 23, 2026. Submissions closed on July 23, 2026. 1 official document is attached below.

  • CONTEXTE ET JUSTIFICATION Le Gouvernement ivoirien met en œuvre le Projet d’Accélération Digitale en Côte d’Ivoire (PADCI), avec l’appui de la Banque mondiale. Aligné sur le Plan National de Développement (PND) 2021-2025, l’Objectif de Développement du Projet (ODP) est de (i) renforcer les fondements de l’écosystème numérique, (ii) étendre l’accès à une connectivité haut débit résiliente au changement climatique, et (iii) améliorer la fourniture et l’adoption de services publics numériques sélectionnés. Le PADCI sera entièrement financé selon le mécanisme de Financement des Projets d’Investissement (IPF) et sa gestion assurée par une unité de coordination mise en place par le Ministère de la Transition Numérique et de l’Innovation Technologique (MTNIT). Le PADCI comporte quatre (4) composantes qui sont : • Composante 1 — Fondements de l’écosystème numérique. Cette composante vise entre autres le soutien au renforcement du cadre institutionnel et juridique favorable à une économie numérique fondée sur la confiance, au renforcement des compétences et à l’amélioration de l’écosystème des données ouvertes sur des secteurs sélectionnés. • Composante 2 — Expansion de la connectivité à haut débit résiliente au changement climatique. Il s’agit ici de l’extension de la connectivité dans les zones rurales et reculées, du renforcement de l’accès à haut débit pour les populations vulnérables, et du soutien à l’expansion de la connectivité à large bande aux ministères, départements et agences de l’État (MDA). • Composante 3 — Amélioration de la fourniture et de l’adoption des services numériques du Gouvernement. Cette composante consistera au renforcement des canaux pour améliorer l'accès inclusif aux services numériques de qualité, au soutien à l’adoption inclusive des services publics numériques, et au renforcement des compétences numériques des femmes et des jeunes en partenariat avec le secteur privé. • Composante 4 — Gestion du Projet L’État ivoirien a initié le Projet d’Accélération Digitale en Côte d’Ivoire (PADCI) afin de consolider et d’accélérer la transformation numérique du pays, notamment à travers l’amélioration de l’accès inclusif aux services numériques et le renforcement des infrastructures et capacités digitales nationales. Malgré les progrès réalisés en matière de dématérialisation des services publics, une partie significative de la population continue de rencontrer des difficultés d’accès aux services numériques, en raison notamment des barrières linguistiques, du faible niveau d’alphabétisation numérique et de la prédominance des interfaces exclusivement en français. Les avancées récentes de l’intelligence artificielle, en particulier dans le domaine des modèles de langage, offrent désormais l’opportunité de transformer profondément l’interaction entre l’administration et les citoyens, grâce à des interfaces conversationnelles multilingues, textuelles et vocales, capables d’intégrer les langues locales et de s’adapter aux usages réels des populations. Dans ce contexte, le Gouvernement a identifié la nécessité de développer à terme un Modèle de Langage de Grande Taille (LLM) multilingue en langues locales, afin de renforcer l’accessibilité, l’inclusivité et l’efficacité des services publics numériques. Cette initiative s’inscrit pleinement dans la mise en œuvre de la Stratégie Nationale de l’Intelligence Artificielle (SNIA), qui fait de la valorisation des langues locales et de l’inclusion numérique un axe stratégique prioritaire. Toutefois, le développement futur d’un tel modèle nécessite au préalable la disponibilité de ressources linguistiques structurées, fiables et représentatives. À cet effet, les présents Termes de Référence (TDR) visent à recruter, au titre d’un projet pilote, un cabinet spécialisé chargé de constituer un corpus linguistique national multilingue de référence, comprenant des données textuelles et vocales en langues ivoiriennes, qui sera mis à la disposition de l’écosystème national de recherche, d’innovation et d’intelligence artificielle. La présente mission pilote constitue ainsi une première phase structurante d’une initiative nationale plus large visant, à terme, le développement de solutions d’intelligence artificielle et de modèles de langage adaptés aux réalités linguistiques et culturelles de la Côte d’Ivoire. • OBJECTIF DE LA MISSION L’objectif général de la mission est de constituer un corpus linguistique national multilingue de référence, structuré, documenté et exploitable, destiné à soutenir le développement futur de solutions d’intelligence artificielle, de traitement automatique des langues et de services numériques inclusifs couvrant cinq langues (dioula, sénoufo, bété, baoulé et nouchi). • OBJECTIFS SPECIFIQUES DE LA MISSION La mission porte sur la constitution d’un corpus linguistique national multilingue de référence en cinq (05) langues ivoiriennes, destiné à soutenir le développement futur de solutions numériques et d’intelligence artificielle, inclusives et adaptées au contexte national. À ce titre, le Prestataire devra : • collecter des données textuelles et vocales représentatives des langues ciblées, en assurant une diversité géographique, sociale et linguistique des locuteurs tout en tenant compte de leur genre et de leur âge;
  • mettre en place la gouvernance : les mécanismes de consentement, d’anonymisation et de protection des données personnelles;
  • réaliser la transcription, l’annotation, l’alignement audio-texte et la structuration des corpus; le prestataire devra proposer les systèmes d’écriture idoines à prendre en compte dès la phase de collecte;[1]
  • assurer le contrôle qualité des données produites;
  • documenter les méthodologies, métadonnées et conventions linguistiques retenues;
  • produire les corpus dans des formats ouverts et interopérables;
  • publier les jeux de données retenus selon les modalités définies par le MTNIT;
  • transférer les données, outils et documentations aux structures désignées par le MTNIT;
  • renforcer les capacités nationales en matière de collecte, annotation et gouvernance des données linguistiques pour 25 bénéficiaires. Le périmètre détaillé de la mission est inclus en ANNEXE 1. Il est attendu que le Prestataire mobilise son expérience en développement d’IA afin de s’assurer que les données produites seront adaptées à l’entraînement de modèles d’IA. • JUSTIFICATION DU CHOIX DES LANGUES, DES STANDARDS ET DES VOLUMES Le choix des langues s’est effectué en fonction du nombre estimé de locuteurs[2]. Selon les données officielles, le Baoulé, le Dioula, le Bété et le Sénoufo figurent parmi les langues les plus parlées en Côte d’Ivoire. A ces quatre langues s’ajoute le « Nouchi », qui est un argot né en Côte d'Ivoire et constitué d'un mélange de français et de plusieurs langues locales ivoiriennes et africaines. Le Nouchi est généralement traité comme un langage à part entière. En conséquence, le Prestataire devra : • Proposer, dès la Phase 1 (cadrage), une convention orthographique explicite et documentée pour le nouchi, soumise à validation du COPIL;
  • Documenter systématiquement les variantes orthographiques rencontrées et les décisions prises;
  • Annoter le « code-switching » au niveau du token (marquage de la langue source pour chaque unité);
  • Documenter la proportion de code-switching par enregistrement et par locuteur;
  • Constituer un lexique de référence du nouchi utilisé dans le corpus, publié avec le corpus. Les standards couramment utilisés dans les projets de reconnaissance automatique de la parole (ASR) et de traitement automatique des langues (NLP) pour langues faiblement dotées sont généralement issues des recommandations techniques de : • la Mozilla Foundation Common Voice (Projet mondial open-source de collecte de données vocales);
  • Masakhane (initiative africaine de NLP open-source);
  • le programme AI4D Africa;
  • les référentiels de l’ITU (Union Internationale des Télécommunications);
  • les jeux de données linguistiques de type FLEURS, Babel, VoxPopuli et CoVoST Les volumes minimaux proposés s’appuient sur les bonnes pratiques observées dans les initiatives internationales de constitution de corpus pour langues à faibles ressources (Mozilla Common Voice, Masakhane, OpenSLR, Babel, FLEURS, XLSR, AI4D Africa, etc.). À ce titre, un volume cible de l’ordre de 100 à 200 heures de données audio annotées par langue est généralement considéré comme un seuil pertinent pour constituer un corpus national exploitable pour des usages futurs de traitement automatique des langues et de reconnaissance vocale. Le volume de cette phase pilote sera fixé à 150 heures. • LIVRABLES Pour chacune des cinq (05) langues couvertes, le Prestataire devra constituer et publier les volumes minimaux suivants, choisis en fonction des usages courants et aux contraintes de coût et de faisabilité dans un contexte pilote 5.1. Corpus Audio Annoté | Paramètre | Spécification minimale | Note | Volume par langue | 150 heures d'audio annoté (soit 750 heures au total sur 5 langues) | seuil fréquemment utilisé pour constituer un corpus exploitable pour des tâches ASR/NLP de base dans des langues à faibles ressources | Format audio | WAV ou FLAC, 16 kHz minimum, 16 bits, mono ou stéréo | Standard audio minimum compatible ASR mode | Annotation | Transcription orthographique, annotation tonale pour langues à tons (baoulé, bété, sénoufo), alignement phonème-texte au niveau du segment, balisage des locuteurs (genre, région, tranche d'âge indicative); marquage du code-switching pour le nouchi | | Diversité | Minimum 200 locuteurs distincts par langue, couverture régionale représentative; équilibre genre ≥ 40 % (femmes); tranches d'âge : 18–30 ans, 31–50 ans, 51 ans et + (minimum 20 % chacune); couverture régionale représentative (≥ 3 zones par langue) | nécessaire pour capturer diversité accents, âges, genres et variabilité acoustiqu

What are the key dates?

  1. Publication

    July 23, 2026

  2. Bid Submission Deadline

    July 23, 2026

  3. Evaluation & Award

    Pending

  4. Contract Signature

    Pending

Procuring Entity

Which documents are available?

Sign in to download the tender documents and be notified automatically of any change to this tender.