Saltar al contenido principal

ETHNOS_APP

Inicio • Búsqueda • Revistas • Lista 0

SGG-Mvar

Cross-Modal Retrieval With Scene Graph Generation and Multiview Attribute Relationship Guidance

Datos Bibliográficos

ID22106930
AutoresSuping Wang (0000-0002-1476-5595, Zhejiang Meteorological Bureau), Fei Zhou (0000-0001-6207-6236, Guangxi Zhuang Autonomous Region Health and Family Planning), Ming Yang (0000-0002-6975-2548, Zhejiang Meteorological Bureau), Lei Shi (0000-0003-1203-9984, Communication University of China), Chaohong Tan (0000-0003-3337-3447, Guangxi Zhuang Autonomous Region Health and Family Planning)
Año2025
Volumen12
Número5
Páginas3671-3683
Fecha de publicación2025-10-01
Peer ReviewedSí
Open AccessSí
TipoARTICLE
RevistaIEEE Transactions on Computational Social Systems (JOURNAL)
Identificadores de la revistaISSN: 2329-924X • E-ISSN: 2373-7476
EditorialInstitute of Electrical and Electronics Engineers (IEEE) (PUBLISHER)
DOI10.1109/tcss.2024.3524297
OpenAlexW4406321963
IdiomaEN
Citas recibidas1
Referencias citadas34

Cross-modal retrieval is crucial for achieving accurate and efficient information retrieval by establishing semantic correlations between heterogeneous images and text. However, traditional image-text training sets suffer from information asymmetry, which includes short lengths and limited sentence structures. This phenomenon often results in insufficient representations of essential visual information. We introduce RichDataset, which offers extensive semantic information. It includes diverse real-life image-text pairs and AI-generated content across domains such as news, entertainment, education, and posters. Compared with classic benchmarks such as Flickr30k and MS-COCO, RichDataset exhibits a novel and balanced distribution. Existing cross-modal retrieval models face challenges in extracting distinct features from the emerging data, leading to low retrieval accuracy. We propose SGG-MVAR, a comprehensive retrieval model guided by multiview scene information and semantic relationships. Leveraging a scene knowledge database, our model parses scene graphs and identifies differences in attributes and relationships. We conduct extensive experiments to evaluate our proposed dataset and model. All experimental results consistently demonstrate a significant improvement in recall for cross-modal retrieval

Computer vision · Graph · Modal · Advanced Image and Video Retrieval Techniques · Computer Science · Image Retrieval and Classification Techniques · Materials Science · Multimodal Machine Learning Applications · Artificial Intelligence · Theoretical Computer Science

  • CDC

    Open Access•Zhaodi Wang, Yangyan Zeng et al.•IEEE Transactions on Computational…•2026

  • Principal component analysis

    Open Access•Svante Wold, Kim H Esbensen et al.•Chemometrics and Intelligent…•1987

  • ImageNet Large Scale Visual Recognition Challenge

    Open Access•Olga Russakovsky, Jia Deng et al.•International Journal of Computer…•2015

Obras citantes distintas1
Citas por año1
Intervalo de citas2026 - 2026 (1)
Velocidad de citacióncurrent
Altamente citadoNo
Tipos de citaNeutras: 1
Ethnos_APP • Proyecto Open Source • Licencia MIT • Frontend v2.0.0 • Privacidad y Cookies • Documentación de la API: api.ethnos.app/docs • Código de la API: GitHub • DOI: 10.5281/zenodo.17049435 • Código del Frontend: GitHub • DOI: 10.5281/zenodo.17050053 • cruz.rio.br • Expectantes Misericordiae