Que é a IA multimodal e en que cambia fronte a un chatbot que só le texto?
Hai tres semanas escribiunos unha clienta que vende lámpadas e decoración online. Quería automatizar un anaco do proceso de devolucións: cando un comprador manda unha foto dicindo “chegou rota”, que alguén do sistema puidese mirar esa imaxe e decidir se aprobar a devolución sen que unha persoa do equipo tivese que abrir cada correo a man.
Iso é xustamente o que fai a IA multimodal: entender texto e imaxe (ás veces tamén audio ou vídeo) na mesma conversa, sen necesitar un sistema á parte para cada tipo de contido. Mándaslle unha foto xunto cunha pregunta e respóndeche sobre o que ve, coma se llo describises a unha persoa por teléfono.
Ata hai un par de anos, montar algo así implicaba pegar pezas soltas: un modelo de visión por un lado que clasificaba a imaxe, un OCR se había texto na foto, e logo un modelo de linguaxe á parte que redactaba a resposta co que os outros dous lle pasaban. Tres sistemas, tres puntos onde algo se pode romper. Cun modelo multimodal coma Claude ou GPT-4o iso redúcese a unha soa chamada: a imaxe entra na mesma xanela de contexto que o texto, e o modelo razoa sobre as dúas cousas á vez.
O prototipo para a clienta montámolo nunha tarde, literal. Pasámoslle a foto e un prompt coas condicións da súa política de devolucións, e o modelo devolve se hai dano visible, de que tipo, e unha nota breve para o equipo. Funciona ben con roturas evidentes (un cristal partido vese decontado) e peor con matices: un pequeno arañazo nun acabado mate, por exemplo, unhas veces detéctao e outras non. Aí seguimos con revisión humana antes de aprobar nada automaticamente. A IA reduce o traballo de mirar cada foto unha por unha. Non substitúe o criterio final.
O que case ninguén pregunta ao principio, e debería, é que pasa con esas fotos unha vez saen do teu servidor. Van á API dun provedor externo igual que pasaría con calquera modelo de linguaxe, así que se a clienta sobe algo con datos persoais visibles (un enderezo nunha etiqueta, unha cara ao fondo) hai que tratalo co mesmo coidado ca calquera outro dato que lle deas a unha IA. No noso caso avisamos á clienta de que as fotos de devolución pasan por ese proceso, e deixámolo por escrito na política, non como nota a pé de páxina.
Aínda non probamos a meter audio no mesmo fluxo, aínda que a mesma clienta xa preguntou se se pode facer algo parecido coas notas de voz que ás veces manda a xente explicando o que pasou. Tecnicamente si se pode. Se paga a pena montalo para o volume de devolucións que ten, esa é outra pregunta da que aínda non teño resposta clara.