Modèles de fondation pour l'agriculture intelligente : des grands modèles linguistiques à l'IA multimodale
L’intelligence artificielle connaît actuellement une transformation majeure avec l’émergence des modèles fondamentaux (Foundation Models), une nouvelle génération de modèles capables d’accomplir une grande variété de tâches à partir des modèles pré-entraînés (Bommasani et al., 2021). Contrairement aux approches traditionnelles d’apprentissage automatique, qui sont généralement conçues pour résoudre une tâche spécifique à partir d’un ensemble de données limité, les modèles fondamentaux sont entraînés sur d’immenses volumes de données multimodales et peuvent être adaptés à différents domaines grâce à l’apprentissage contextuel (in-context learning), à l’ajustement fin (fine-tuning) ou à la génération augmentée par récupération (Retrieval-Augmented Generation).
Cette session vise à présenter les principes fondamentaux de ces technologies et à explorer leur potentiel pour le secteur agricole. Les participants découvriront les principales familles de modèles utilisées aujourd’hui, notamment les grands modèles de langage (LLM), les modèles vision-langage (VLM), les modèles multimodaux (MLLM), les petits modèles de langage (SLM) ainsi que les approches TinyML destinées aux plateformes embarquées à faibles ressources. Une attention particulière sera accordée aux capacités de raisonnement, de compréhension multimodale et d’aide à la décision qui distinguent les modèles fondamentaux des systèmes d’intelligence artificielle conventionnels (Li et al., 2023).
Les exemples présentés démontreront comment ces technologies peuvent intégrer simultanément des données textuelles, des images, des vidéos, des données de capteurs et des données historiques afin d’assister la prise de décision en agriculture. Les applications abordées incluront notamment le suivi des cultures, la détection précoce des maladies, l’agriculture de précision, l’analyse d’images provenant de drones, la surveillance des infrastructures agricoles et le soutien aux opérations agricoles. Ces applications s’inscrivent dans les tendances récentes identifiées dans la littérature scientifique portant sur les modèles fondamentaux en agriculture (Li et al., 2024; Zhu et al., 2024).
La deuxième partie de la session prendra la forme d’une activité pratique permettant aux participants de mettre en œuvre une chaîne de traitement multimodale alimentée par des modèles fondamentaux. À travers des démonstrations concrètes, ils apprendront comment préparer des données, interagir efficacement avec les modèles à l’aide de techniques d’ingénierie de requêtes (prompt engineering), intégrer différentes modalités de données et développer des applications capables de résoudre des problématiques agricoles réelles.
À la fin de la session, les participants auront acquis une compréhension des capacités, des limites et des opportunités offertes par les modèles fondamentaux pour le secteur agricole, ainsi que des connaissances pratiques leur permettant d’intégrer ces technologies dans leurs propres projets de recherche, de développement ou d’innovation.
Références
- Bommasani, R., Hudson, D. A., Adeli, E., et al. (2021). On the Opportunities and Risks of Foundation Models. Stanford Center for Research on Foundation Models.
- Li, C., Gan, Z., Yang, Z., Yang, J., Li, L., Wang, L., & Gao, J. (2023). Multimodal Foundation Models: From Specialists to General-Purpose Assistants. arXiv:2309.10020.
- Li, J., Xu, M., Xiang, L., et al. (2024). Foundation Models in Smart Agriculture: Basics, Opportunities and Challenges. Computers and Electronics in Agriculture, 222, 109032.
- Zhu, H., Qin, S., Su, M., Lin, C., Li, A., & Gao, J. (2024). Harnessing Large Vision and Language Models in Agriculture: A Review. arXiv:2407.19679.

Haechan Mark Bong
Doctorant en 4e année en robotique et intelligence artificielle dans le domaine spatial et agricole
Polytechnique Montréal
Mark est en dernière année de doctorat en génie informatique au MILA, à Polytechnique Montréal et à Astrolith (institut spatial), où il avance la recherche sur l’application des modèles de fondation à la robotique spatiale et agricole. Il a obtenu son baccalauréat en informatique et sa maîtrise en sciences animales à l’Université McGill, sous la supervision du professeur Kevin Wade, du docteur René Lacroix et du docteur Maxime Leduc, en collaboration avec Valacta, afin de construire un modèle d’intelligence artificielle pour la prédiction des données d’ensilage.