{"id":61920,"date":"2026-09-17T14:53:06","date_gmt":"2026-09-17T13:53:06","guid":{"rendered":"https:\/\/iberopress.es\/index.php\/2026\/09\/17\/una-investigacion-del-centro-hitz-de-la-ehu-aporta-una-estrategia-para-mejorar-la-ia-en-lenguas-con-pocos-recursos-como-el-euskera\/"},"modified":"2026-09-17T14:53:06","modified_gmt":"2026-09-17T13:53:06","slug":"una-investigacion-del-centro-hitz-de-la-ehu-aporta-una-estrategia-para-mejorar-la-ia-en-lenguas-con-pocos-recursos-como-el-euskera","status":"publish","type":"post","link":"https:\/\/iberopress.es\/index.php\/2026\/09\/17\/una-investigacion-del-centro-hitz-de-la-ehu-aporta-una-estrategia-para-mejorar-la-ia-en-lenguas-con-pocos-recursos-como-el-euskera\/","title":{"rendered":"Una investigaci\u00f3n del Centro HiTZ de la EHU aporta una estrategia para mejorar la IA en lenguas con pocos recursos como el euskera"},"content":{"rendered":"<p><a href=\"https:\/\/static.comunicae.com\/photos\/notas\/1274762\/julenetxanizHiTZ3.jpg\" target=\"_blank\" class=\"fotonota\"> <img decoding=\"async\" src=\"https:\/\/static.comunicae.com\/photos\/notas\/1274762\/julenetxanizHiTZ3.jpg\" style=\"max-width:600px\" border=\"0\" class=\"postImage\" alt=\"\" \/><\/a><\/p>\n<p>La tesis de Julen Etxaniz, investigador del Centro de Investigaci\u00f3n de la Universidad del Pa\u00eds Vasco, demuestra que es posible mejorar la inteligencia artificial en lenguas con pocos recursos como el euskera, adaptando modelos existentes, sin entrenarlos desde cero desarrolla una estrategia abierta para adaptar modelos de lenguaje a lenguas con pocos recursos digitales<\/p>\n<p>La investigaci\u00f3n demuestra que los modelos de inteligencia artificial pueden mejorar significativamente su dominio del euskera y de la cultura vasca mediante la adaptaci\u00f3n de modelos existentes, evitando el elevado coste de entrenarlos desde cero.<\/p>\n<p>La tesis desarrolla Latxa, una familia de modelos de lenguaje abiertos espec\u00edficamente adaptados al euskera y a la realidad cultural vasca, que ya se utiliza en herramientas de asistencia conversacional y traducci\u00f3n.<\/p>\n<p>Los m\u00e9todos desarrollados pueden aplicarse tambi\u00e9n a otras lenguas con pocos recursos, como el catal\u00e1n, el gallego, el occitano o el maor\u00ed, contribuyendo a una inteligencia artificial m\u00e1s inclusiva y menos dependiente de las lenguas mayoritarias.<\/p>\n<p>La inteligencia artificial no parte de las mismas condiciones para todas las lenguas. Los grandes modelos de lenguaje aprenden principalmente a partir de los textos disponibles en internet y, mientras que el ingl\u00e9s y el castellano cuentan con grandes cantidades de datos digitales, otras lenguas disponen de muchos menos corpus, modelos abiertos y herramientas para evaluar el rendimiento de la IA. Esta desigualdad hace que los sistemas de inteligencia artificial comprendan y generen peor estas lenguas y, adem\u00e1s, tengan un conocimiento m\u00e1s limitado de la realidad cultural de sus hablantes.<\/p>\n<p>Abordar este problema ha sido el objetivo de la tesis doctoral <em>Hizkuntza-ereduak hobetzen baliabide gutxiko hizkuntzetan<\/em> (Mejora de los modelos de lenguaje para lenguas con escasos recursos), presentada recientemente por Julen Etxaniz, investigador del <a href=\"https:\/\/www.hitz.eus\/es\" target=\"_blank\" rel=\"nofollow\">Centro HiTZ de la Universidad del Pa\u00eds Vasco (EHU).<\/a><\/p>\n<p>La principal conclusi\u00f3n del trabajo es que no es necesario entrenar un gran modelo de inteligencia artificial desde cero para conseguir mejores resultados en una lengua con pocos recursos. La investigaci\u00f3n demuestra que es posible aprovechar modelos de lenguaje existentes y adaptarlos a las necesidades espec\u00edficas de cada comunidad ling\u00fc\u00edstica: &#8220;Mi tesis demuestra que podemos mejorar la inteligencia artificial en lenguas con pocos recursos como el euskera adaptando modelos existentes, sin entrenarlos desde cero&#8221;, explica Julen Etxaniz.<\/p>\n<p>El trabajo plantea as\u00ed una <strong>v\u00eda para que el avance de la inteligencia artificial no quede limitado a las lenguas que cuentan con grandes cantidades de datos digitales<\/strong>. La experiencia desarrollada en euskera demuestra que las comunidades ling\u00fc\u00edsticas con menos recursos pueden disponer tambi\u00e9n de modelos abiertos, competitivos y adaptados a su realidad, siempre que se combinen investigaci\u00f3n espec\u00edfica, datos de calidad y sistemas adecuados de evaluaci\u00f3n.<\/p>\n<p>La investigaci\u00f3n plantea una estrategia completa y abierta para mejorar la inteligencia artificial en este tipo de lenguas. Entre sus principales aportaciones se encuentra Latxa, una familia de modelos de lenguaje abiertos desarrollados para el euskera y adaptados tambi\u00e9n a la cultura y al contexto vasco.<\/p>\n<p>La diferencia es especialmente relevante cuando se utilizan estos sistemas para interactuar en euskera. Un modelo entrenado fundamentalmente con contenidos en ingl\u00e9s o castellano puede ser capaz de generar texto en euskera, pero no necesariamente comprende la lengua con el mismo nivel de profundidad ni conoce adecuadamente las referencias culturales y el contexto local: &#8220;El objetivo no es solo que la IA traduzca o escriba en euskera. Tambi\u00e9n debe desenvolverse de forma fiable en la lengua y conocer la realidad cultural de sus hablantes&#8221;, se\u00f1ala el investigador.<\/p>\n<p><strong>De la investigaci\u00f3n a la ciudadan\u00eda<\/strong><br \/>\nLos resultados de la tesis tienen aplicaciones directas en algunos de los usos m\u00e1s habituales de la inteligencia artificial, como los asistentes conversacionales y la traducci\u00f3n autom\u00e1tica. Por ejemplo, una persona que consulte en euskera a un asistente de IA sobre un aspecto concreto de la cultura vasca puede obtener, gracias a un modelo adaptado, una respuesta m\u00e1s natural y contextualizada, sin tener que recurrir al castellano. Del mismo modo, los avances en los modelos de lenguaje pueden contribuir a mejorar la calidad de las traducciones autom\u00e1ticas al euskera.<\/p>\n<p>En este \u00e1mbito, Latxa ha mostrado mejores resultados como traductor que modelos especializados de traducci\u00f3n anteriores. Tanto el modelo como las herramientas desarrolladas a partir de esta investigaci\u00f3n ya est\u00e1n disponibles para la ciudadan\u00eda a trav\u00e9s de Latxa.<\/p>\n<p>&#8220;La adaptaci\u00f3n aporta un mejor dominio del euskera y m\u00e1s conocimiento sobre la cultura y el entorno local. Adem\u00e1s, los recursos son abiertos, lo que permite que la comunidad pueda adaptarlos y evaluarlos de forma independiente&#8221;, destaca Etxaniz.<\/p>\n<p><strong>Un m\u00e9todo aplicable a otras lenguas<\/strong><br \/>\nAunque el euskera constituye uno de los principales casos de estudio de la tesis, la metodolog\u00eda desarrollada no est\u00e1 vinculada exclusivamente a esta lengua. El trabajo demuestra que <strong>el mismo planteamiento puede utilizarse para mejorar modelos de IA en otras lenguas con pocos recursos digitales,<\/strong> siempre que se realice un trabajo espec\u00edfico para cada comunidad.<\/p>\n<p>De hecho, investigadores de Hitz ya han aplicado estos m\u00e9todos a lenguas con caracter\u00edsticas diferentes, entre ellas el catal\u00e1n, el gallego, el occitano y el maor\u00ed.<\/p>\n<p>&#8220;El euskera sirve como caso de estudio para desarrollar m\u00e9todos \u00fatiles para muchas otras comunidades&#8221;, explica Etxaniz. &#8220;Los resultados no son autom\u00e1ticos: cada lengua necesita corpus de calidad y pruebas que reflejen tanto sus caracter\u00edsticas ling\u00fc\u00edsticas como su cultura&#8221;.<\/p>\n<p>Otro de los elementos destacados de la tesis es su apuesta por la ciencia abierta. <strong>Los modelos, datos, evaluaciones y programas desarrollados en el marco de la investigaci\u00f3n est\u00e1n disponibles con licencias abiertas<\/strong>, de manera que otros investigadores y comunidades puedan reutilizarlos, comprobar los resultados y continuar desarroll\u00e1ndolos. De hecho, los desarrollos realizados ya est\u00e1n sirviendo de base para nuevas investigaciones relacionadas con el seguimiento de instrucciones, la veracidad de los modelos y la inteligencia artificial multimodal, y Latxa se ha incorporado a herramientas reales de asistencia y traducci\u00f3n.\u00a0<\/p>\n<p>Los tres trabajos principales que forman parte de la investigaci\u00f3n fueron publicados en algunas de las principales conferencias internacionales del \u00e1mbito como NAACL, ACL y NeurIPS. El trabajo sobre Latxa recibi\u00f3, adem\u00e1s, el premio al mejor art\u00edculo de recursos en ACL 2024.<\/p>\n<p><a href=\"https:\/\/www.hitz.eus\/es\" target=\"_blank\" title=\"https:\/\/www.hitz.eus\/es\" rel=\"nofollow\"><strong>Centro HiTZ \u2013 Basque Center for Language Technology<\/strong><\/a><br \/>\nEl Centro HiTZ es un centro de investigaci\u00f3n de la Universidad del Pa\u00eds Vasco (EHU) especializado en tecnolog\u00edas del lenguaje y procesamiento del lenguaje natural. Su actividad abarca \u00e1reas como la inteligencia artificial, los modelos de lenguaje, la traducci\u00f3n autom\u00e1tica, el reconocimiento y s\u00edntesis del habla y las tecnolog\u00edas multiling\u00fces, con especial atenci\u00f3n al euskera y a otras lenguas con pocos recursos. El centro trabaja para desarrollar tecnolog\u00edas ling\u00fc\u00edsticas avanzadas y ponerlas al servicio de la sociedad, impulsando al mismo tiempo la investigaci\u00f3n abierta y la colaboraci\u00f3n cient\u00edfica a nivel internacional.<\/p>\n","protected":false},"excerpt":{"rendered":"La tesis de Julen Etxaniz, investigador del Centro de Investigaci\u00f3n de la Universidad del Pa\u00eds Vasco, demuestra que&hellip;","protected":false},"author":1,"featured_media":0,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"csco_display_header_overlay":false,"csco_singular_sidebar":"","csco_page_header_type":"","csco_page_load_nextpost":"","csco_post_video_location":[],"csco_post_video_location_hash":"","csco_post_video_url":"","csco_post_video_bg_start_time":0,"csco_post_video_bg_end_time":0,"footnotes":""},"categories":[47],"tags":[1099,993,1005,1050,1036,1028,985],"class_list":["post-61920","post","type-post","status-publish","format-standard","category-comunicados","tag-idiomas","tag-innovacion-tecnologica","tag-inteligencia-artificial-y-robotica","tag-investigacion-cientifica","tag-pais-vasco","tag-programacion","tag-sala-de-prensa","cs-entry","cs-video-wrap"],"_links":{"self":[{"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/posts\/61920","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/comments?post=61920"}],"version-history":[{"count":0,"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/posts\/61920\/revisions"}],"wp:attachment":[{"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/media?parent=61920"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/categories?post=61920"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/iberopress.es\/index.php\/wp-json\/wp\/v2\/tags?post=61920"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}