1
Frame Augmented Alternating Attention Network for Video Question Answering
2
Movie Question Answering via Textual Memory and Plot Graph
3
STAT: Spatial-Temporal Attention Mechanism for Video Captioning
4
Hierarchical Global-Local Temporal Modeling for Video Captioning
5
Learnable Aggregating Net with Diversity Learning for Video Question Answering
6
Question-Aware Tube-Switch Network for Video Question Answering
7
Attention-based Densely Connected LSTM for Video Captioning
8
Critic-based Attention Network for Event-based Video Captioning
9
Multi-interaction Network with Object Relation for Video Question Answering
10
CLEVRER: CoLlision Events for Video REpresentation and Reasoning
11
Dual-Stream Recurrent Neural Network for Video Captioning
12
Watch It Twice: Video Captioning with a Refocused Video Encoder
13
Beyond RNNs: Positional Self-Attention with Co-Attention for Video Question Answering
14
Video Question Generation via Semantic Rich Cross-Modal Self-Attention Networks Learning
15
ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering
16
Social-IQ: A Question Answering Benchmark for Artificial Social Intelligence
17
Unified Language Model Pre-training for Natural Language Understanding and Generation
18
Heterogeneous Memory Enhanced Multimodal Attention Model for Video Question Answering
19
Information Maximizing Visual Question Generation
20
SibNet: Sibling Convolutional Encoder for Video Captioning
21
Hierarchical Memory Modelling for Video Captioning
22
Spotting and Aggregating Salient Regions for Video Captioning
23
TVQA: Localized, Compositional Video Question Answering
24
Move Forward and Tell: A Progressive Generator of Video Descriptions
25
Open-Ended Long-form Video Question Answering via Adaptive Hierarchical Reinforced Networks
26
End-to-End Dense Video Captioning with Masked Transformer
27
Motion-Appearance Co-memory Networks for Video Question Answering
28
Automatic differentiation in PyTorch
29
Video Question Answering via Gradually Refined Attention over Appearance and Motion
30
Richer Semantic Visual and Language Representation for Video Captioning
31
Knowing Yourself: Improving Video Caption via In-depth Recap
32
Multirate Multimodal Video Captioning
33
Video Question Answering via Hierarchical Dual-Level Attention Network Learning
34
Learning Multimodal Attention LSTM Networks for Video Captioning
35
Catching the Temporal Regions-of-Interest for Video Captioning
36
iVQA: Inverse Visual Question Answering
37
Visual Question Generation as Dual Task of Visual Question Answering
38
Video Captioning with Guidance of Multimodal Latent Topics
39
Video Question Answering via Hierarchical Spatio-Temporal Attention Networks
40
Obj2Text: Generating Visually Descriptive Language from Object Layouts
41
StyleNet: Generating Attractive Visual Captions with Styles
42
Attention is All you Need
43
TGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question Answering
44
Incorporating Global Visual Features into Attention-based Neural Machine Translation.
45
OpenNMT: Open-Source Toolkit for Neural Machine Translation
46
Video Captioning with Multi-Faceted Attention
47
NewsQA: A Machine Comprehension Dataset
48
Semantic Compositional Networks for Visual Captioning
49
Video Captioning with Transferred Semantic Attributes
50
Leveraging Video Descriptions to Learn Video Question Answering
51
SQuAD: 100,000+ Questions for Machine Comprehension of Text
52
MSR-VTT: A Large Video Description Dataset for Bridging Video and Language
53
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
54
Deep Residual Learning for Image Recognition
55
ActivityNet: A large-scale video benchmark for human activity understanding
56
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks
57
Jointly Modeling Embedding and Translation to Bridge Video and Language
58
VQA: Visual Question Answering
59
Sequence to Sequence -- Video to Text
60
End-To-End Memory Networks
61
Describing Videos by Exploiting Temporal Structure
62
Adam: A Method for Stochastic Optimization
63
CIDEr: Consensus-based image description evaluation
64
GloVe: Global Vectors for Word Representation
65
Collecting Highly Parallel Data for Paraphrase Evaluation
66
METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments
67
ROUGE: A Package for Automatic Evaluation of Summaries
68
WordNet::Similarity - Measuring the Relatedness of Concepts
69
Bleu: a Method for Automatic Evaluation of Machine Translation
70
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding