Publicação
iGenTrivia: intelligent content generation system for trivia games
| datacite.subject.fos | Engenharia e Tecnologia::Engenharia Eletrotécnica, Eletrónica e Informática | |
| dc.contributor.advisor | Torres, José | |
| dc.contributor.advisor | Moreira, Rui Silva | |
| dc.contributor.author | Gonçalves, Manuel José Silva | |
| dc.date.accessioned | 2026-08-04T09:22:39Z | |
| dc.date.available | 2026-08-04T09:22:39Z | |
| dc.date.issued | 2026-07-23 | |
| dc.description.abstract | The digital migration of trivia games significantly expanded their reach and accelerated development; however, the demand for high-quality, diverse, and accurate content remains a critical bottleneck. Traditional human-generated content is time-consuming, while early attempts at automated generation often suffer from quality issues. Although Large Language Models (LLMs) offer a promising solution for content scaling, they are prone to hallucinations and factual inconsistencies errors that are unacceptable in a trivia context. This thesis addresses these limitations by proposing a novel, automated content generation system that integrates Retrieval-Augmented Generation (RAG) with a multi-agent validation pipeline. The system employs distinct LLM roles for generation, fact-checking, and answer verification, utilising a consensusbased mechanism to filter low-confidence outputs. By leveraging vector embeddings for semantic duplicate detection and cross-referencing answers across multiple models, the pipeline ensures high factual integrity. Evaluated across English (United States) and European Portuguese, the system achieved 100% factual correctness in both languages, eliminating the residual hallucinations present in the single-model baseline, and reduced the semantic duplicate rate by up to 15 percentage points (from 21.74% to 6.76% in English, and from 23.87% to 14.40% in Portuguese). On the efficiency dimension, the pipeline improved the question yield rate by over 30 percentage points in both languages 88% versus 53% for English, and 80% versus 49% for Portuguese requiring 44% fewer generated candidates and half the number of API calls to reach the same output target. The result is a scalable, language-agnostic framework capable of producing high-quality trivia content with minimal human intervention. | eng |
| dc.description.abstract | A migração digital dos jogos de trívia expandiu significativamente o seu alcance e acelerou o seu desenvolvimento; no entanto, a procura por conteúdo de alta qualidade, diversificado e preciso continua a ser um gargalo critico. O conteúdo tradicional gerado por humanos e demorado, enquanto as primeiras tentativas de geração automatizada muitas vezes sofrem de problemas de qualidade. Embora os Modelos de Linguagem Grande (LLMs) ofereçam uma solução promissora para o dimensionamento de conteúdo, eles são propensos a alucinações e inconsistências factuais — erros que são inaceitáveis num contexto de trivia. Esta tese aborda essas limitações propondo um sistema inovador de geração automatizada de conteúdo que integra a Geração Aumentada por Recuperação (RAG) com um pipeline de validação multiagente. O sistema emprega funções LLM distintas para geração, verificação de factos e verificação de respostas, utilizando um mecanismo baseado em consenso para filtrar resultados de baixa confiança. Ao aproveitar as incorporações vetoriais para deteção semântica de duplicados e referencias cruzadas de respostas em vários modelos, o pipeline garante elevada integridade factual. Avaliado em inglês (Estados Unidos) e português europeu, o sistema atingiu 100% de correção factual em ambas as línguas, eliminando as alucinações residuais presentes na linha de base de modelo único, e reduziu a taxa de duplicados semânticos ate 15 pontos percentuais (de 21,74% para 6,76% em inglês, e de 23,87% para 14,40% em português). Na dimensão da eficiência, o pipeline melhorou a taxa de aceitação de questões em mais de 30 pontos percentuais em ambas as línguas 88% face a 53% em inglês, e 80% face a 49% em português exigindo 44% menos candidatos gerados e metade das chamadas a API para atingir o mesmo objetivo. O resultado e uma estrutura escalável e independente da língua, capaz de produzir conteúdo de trivia de alta qualidade com intervenção humana mínima. | por |
| dc.identifier.uri | http://hdl.handle.net/10284/15542 | |
| dc.language.iso | eng | |
| dc.rights.uri | http://creativecommons.org/licenses/by/4.0/ | |
| dc.title | iGenTrivia: intelligent content generation system for trivia games | eng |
| dc.type | master thesis | |
| dspace.entity.type | Publication | |
| thesis.degree.name | Mestrado em Engenharia Informática, ramo de Computação Móvel |
Ficheiros
Principais
1 - 1 de 1
Miniatura indisponível
- Nome:
- DM_43087.pdf
- Tamanho:
- 1.29 MB
- Formato:
- Adobe Portable Document Format
- Descrição:
- Dissertação de mestrado_43087
Licença
1 - 1 de 1
Miniatura indisponível
- Nome:
- license.txt
- Tamanho:
- 4.03 KB
- Formato:
- Item-specific license agreed upon to submission
- Descrição:
