Pular para o conteúdo principal

ETHNOS_APP

Início • Busca • Periódicos • Lista 0

SGG-Mvar

Cross-Modal Retrieval With Scene Graph Generation and Multiview Attribute Relationship Guidance

Dados Bibliográficos

ID22106930
AutoresSuping Wang (0000-0002-1476-5595, Zhejiang Meteorological Bureau), Fei Zhou (0000-0001-6207-6236, Guangxi Zhuang Autonomous Region Health and Family Planning), Ming Yang (0000-0002-6975-2548, Zhejiang Meteorological Bureau), Lei Shi (0000-0003-1203-9984, Communication University of China), Chaohong Tan (0000-0003-3337-3447, Guangxi Zhuang Autonomous Region Health and Family Planning)
Ano2025
Volume12
Fascículo5
Páginas3671-3683
Data de publicação2025-10-01
Peer ReviewedSim
Open AccessSim
TipoARTICLE
PeriódicoIEEE Transactions on Computational Social Systems (JOURNAL)
Identificadores do periódicoISSN: 2329-924X • E-ISSN: 2373-7476
EditoraInstitute of Electrical and Electronics Engineers (IEEE) (PUBLISHER)
DOI10.1109/tcss.2024.3524297
OpenAlexW4406321963
IdiomaEN
Citações recebidas1
Referências citadas34

Cross-modal retrieval is crucial for achieving accurate and efficient information retrieval by establishing semantic correlations between heterogeneous images and text. However, traditional image-text training sets suffer from information asymmetry, which includes short lengths and limited sentence structures. This phenomenon often results in insufficient representations of essential visual information. We introduce RichDataset, which offers extensive semantic information. It includes diverse real-life image-text pairs and AI-generated content across domains such as news, entertainment, education, and posters. Compared with classic benchmarks such as Flickr30k and MS-COCO, RichDataset exhibits a novel and balanced distribution. Existing cross-modal retrieval models face challenges in extracting distinct features from the emerging data, leading to low retrieval accuracy. We propose SGG-MVAR, a comprehensive retrieval model guided by multiview scene information and semantic relationships. Leveraging a scene knowledge database, our model parses scene graphs and identifies differences in attributes and relationships. We conduct extensive experiments to evaluate our proposed dataset and model. All experimental results consistently demonstrate a significant improvement in recall for cross-modal retrieval

Computer vision · Graph · Modal · Advanced Image and Video Retrieval Techniques · Computer Science · Image Retrieval and Classification Techniques · Materials Science · Multimodal Machine Learning Applications · Artificial Intelligence · Theoretical Computer Science

  • CDC

    Open Access•Zhaodi Wang, Yangyan Zeng et al.•IEEE Transactions on Computational…•2026

  • Principal component analysis

    Open Access•Svante Wold, Kim H Esbensen et al.•Chemometrics and Intelligent…•1987

  • ImageNet Large Scale Visual Recognition Challenge

    Open Access•Olga Russakovsky, Jia Deng et al.•International Journal of Computer…•2015

Obras citantes distintas1
Citações por ano1
Intervalo de citações2026 - 2026 (1)
Velocidade de citaçãocurrent
Altamente citadoNão
Tipos de citaçãoNeutras: 1
Ethnos_APP • Projeto Open Source • Licença MIT • Frontend v2.0.0 • Privacidade e Cookies • Documentação da API: api.ethnos.app/docs • Código da API: GitHub • DOI: 10.5281/zenodo.17049435 • Código do Frontend: GitHub • DOI: 10.5281/zenodo.17050053 • cruz.rio.br • Expectantes Misericordiae