MASTER OF SCIENCE DATA SCIENCE AND INFORMATICS (MDS)
| Module Code | Module Name | Description |
|---|---|---|
|
MDS501
|
Big Data Analytics |
Introduction to Big Data, Data Mining, Data Analytics, Predictive Analysis and Business Intelligence, Large Scale File System: Distributed File System, MapReduce, HDFS and Hadoop, Mining Big Data, Advanced Data Analytics and Machine Learning, Big Data Streams and Real Time Predictive Analysis, Tools and Visualization, Link Analysis, Web Analytics, Collaborative Filtering, Social Network Analysis, Issues, Challenges and Opportunities with Big Data and its Analytics |
|
MDS502 |
Algorithms for Advanced Analytics |
This course gives a comprehensive coverage of algorithms specially meant for analyzing data at an in-depth level. It covers; Classification algorithms; boosting, bagging stacking etc; Decision Trees; Introduction to Decision trees –Splitting approaches in decision tree – Classification by decision tree induction – Tree pruning methods (Cost complexity pruning – Chi square pruning) – Issues in decision trees –Extended Decision Trees (fuzzy decision trees); Text analytics; Introduction – Text mining operations –Border increment text mining algorithm – Preprocessing techniques – Feature selection using dimensionality reduction – Singular Value Decomposition – Hidden Markov Probabilistic Model for Information Extraction; Neural Networks |
|
MDS503 |
Computing for Data Analytics |
This will cover the following; Data Analytics lifecycle, Introduction to Big data Business Analytics – State of the practice in analytics role of data scientists – Key roles for successful analytic project – Main phases of life cycle – Developing core deliverables for stakeholders. Statistics; Sampling Techniques – Data classification, Tabulation, Frequency and Graphic representation – Measures of central value – Arithmetic mean, Geometric mean, Harmonic mean, Mode, Median, Quartiles, Deciles, Percentile – Measures of variation – Range, IQR, Quartile deviation, Mean deviation, standard deviation, coefficient variance, skewness, Moments & Kurtosis. Probability and Hypothesis Testing; Time Series Forecasting And Design Of Experiments |
|
MDS504 |
Advanced Programming for Data Analytics |
This course covers the following; python concepts , data structures, classes; data wrangling combining and merging datasets – reshaping and pivoting – data transformation – string manipulation, regular expressions; data aggregation, group operations ,timeseries; web scraping ; data acquisition by scraping web applications –submitting a form – fetching web pages – downloading web pages through form submission – css selectors; visualization in python matplotlib package – plotting graphs – controlling graph – adding text – more graph types – getting and setting values – patches. |
|
MDS505 |
Data Visualisation |
This module combines the art and science of communicating data insights through graphical representation. Indicative content focuses on the cognitive principles of visual perception and the design of effective dashboards. Students will utilize tools like Tableau or PowerBI and libraries such as D3.js, Matplotlib, and Seaborn. The course covers the creation of interactive visualizations, geospatial mapping, and the storytelling techniques required to present complex findings to non-technical stakeholders. |
|
MDS506 |
Bio Inspired Computing |
This module examines computational models inspired by natural systems and biological processes to solve complex optimization problems. Indicative content includes Genetic Algorithms (GA) based on evolution, Ant Colony Optimization (ACO), and Swarm Intelligence. Students will study Neural Networks inspired by the human brain, including deep learning architectures, as well as fuzzy logic and evolutionary strategies that allow for adaptive and robust problem-solving in uncertain environments. |
|
MDS507 |
Streaming Analytics |
This module addresses the challenges of analyzing data in real-time as it is generated, rather than in batches. Indicative content involves the study of stream processing engines like Apache Kafka, Flink, and Spark Streaming. Students will learn about windowing techniques, event-time processing, and managing state in distributed streams. The course emphasizes practical applications such as real-time fraud detection, sensor data monitoring (IoT), and live social media sentiment analysis. |
|
MDS508 |
Social Network Analytics |
This module focuses on the structure and dynamics of networked relationships in social contexts using graph theory. Indicative content-Introduction To Stream Computing; Streaming Data – Sources – Difference Between Streaming Data And Static Data. Overview Of Large Scale Stream Processing Engines – Issues In Stream Processing. Unit Ii – Streaming Analytics Architecture ; Phases In Streaming Analytics Architecture – Vital Attributes – High Availability – Low Latency – Horizontal Scalability-Fault Tolerance – Service Configuration And Management – Apache Zookeeper. Data Flow Management ; Distributed Data Flows – At Least One Delivery – Apache Kafka – Apache Flume – Zero Mq – Messages, Events, Tasks & File Passing. Processing & Storing Streaming Data Distributed Stream Data Processing: Co-Ordination, Partition And Merges, Transactions. Duplication Detection Using Bloom Filters – Apache Spark Streaming Examples Choosing A Storage System – Nosql Storage Systems. Delivering Streaming Metrics Visualizing Data – Mobile Streaming Apps –Times Counting And Summation – Stochastic Optimization – Delivering Time Series Data. |
|
MDS560 |
Dissertation |
The dissertation is the final project of the Master’s program, requiring an original and independent research contribution to the field of Data Science. Indicative content includes formalizing a research question, conducting a rigorous systematic literature review, and selecting appropriate methodologies for data collection and analysis. Students will execute a significant data-driven project, document their methodology and findings in a peer-reviewed format, and present their work in a final viva voce or defense.The research findings are expected to be published in peer reviewed journals or conference proceedings. Finally all the work should be presented in a thesis. |



