{"id":"d5240c4d-5986-413f-afda-44af51f04cc4","slug":"clawhub-mtsatryan-ah-data-scientist","name":"data-scientist","description":"You are a data scientist with expertise in statistical analysis, machine learning, data visualization, and experimental design. Use when: statistical analysi...","canonicalUrl":"https://www.xpersona.co/agent/clawhub-mtsatryan-ah-data-scientist","sourceUrl":"https://clawhub.ai/mtsatryan/ah-data-scientist","homepage":"https://clawhub.ai/mtsatryan/skills/ah-data-scientist","source":"CLAWHUB","vendor":{"slug":"clawhub","label":"Clawhub","url":"https://clawhub.ai/mtsatryan/skills/ah-data-scientist"},"protocols":["OPENCLEW"],"capabilities":[],"trustScore":null,"trustConfidence":"unknown","artifactCount":0,"benchmarkCount":0,"lastRelease":"1.0.0","freshnessAt":"2026-10-11T05:26:59.311Z","freshnessLabel":"Oct 11, 2026","securityReviewed":true,"openapiReady":false,"stats":[{"label":"Trust score","value":"Unknown"},{"label":"Compatibility","value":"OpenClaw"},{"label":"Freshness","value":"Oct 11, 2026"},{"label":"Vendor","value":"Clawhub"},{"label":"Artifacts","value":"0"},{"label":"Benchmarks","value":"0"},{"label":"Last release","value":"1.0.0"}],"factsPreview":[{"factKey":"vendor","category":"vendor","label":"Vendor","value":"Clawhub","href":"https://clawhub.ai/mtsatryan/skills/ah-data-scientist","sourceUrl":"https://clawhub.ai/mtsatryan/skills/ah-data-scientist","sourceType":"profile","confidence":"medium","observedAt":"2026-10-11T05:26:59.369Z","isPublic":true},{"factKey":"protocols","category":"compatibility","label":"Protocol compatibility","value":"OpenClaw","href":"https://www.xpersona.co/api/v1/agents/clawhub-mtsatryan-ah-data-scientist/contract","sourceUrl":"https://www.xpersona.co/api/v1/agents/clawhub-mtsatryan-ah-data-scientist/contract","sourceType":"contract","confidence":"medium","observedAt":"2026-10-11T05:26:59.369Z","isPublic":true},{"factKey":"traction","category":"adoption","label":"Adoption signal","value":"1.1K downloads","href":"https://clawhub.ai/mtsatryan/ah-data-scientist","sourceUrl":"https://clawhub.ai/mtsatryan/ah-data-scientist","sourceType":"profile","confidence":"medium","observedAt":"2026-10-11T05:26:59.369Z","isPublic":true},{"factKey":"latest_release","category":"release","label":"Latest release","value":"1.0.0","href":"https://clawhub.ai/mtsatryan/ah-data-scientist","sourceUrl":"https://clawhub.ai/mtsatryan/ah-data-scientist","sourceType":"release","confidence":"medium","observedAt":"2026-04-30T12:42:45.733Z","isPublic":true},{"factKey":"handshake_status","category":"security","label":"Handshake status","value":"UNKNOWN","href":"https://www.xpersona.co/api/v1/agents/clawhub-mtsatryan-ah-data-scientist/trust","sourceUrl":"https://www.xpersona.co/api/v1/agents/clawhub-mtsatryan-ah-data-scientist/trust","sourceType":"trust","confidence":"medium","observedAt":null,"isPublic":true}],"highlights":["1.1K downloads","Trust evidence available"],"agentCard":{"name":"data-scientist","description":"You are a data scientist with expertise in statistical analysis, machine learning, data visualization, and experimental design. Use when: statistical analysi...","source":"CLAWHUB","sourceId":"clawhub:s17bvyvkfhp17ybx0q3ak5dcsn85nqpv:ah-data-scientist","homepage":"https://clawhub.ai/mtsatryan/skills/ah-data-scientist","repository":"https://clawhub.ai/mtsatryan/ah-data-scientist","documentation":"https://www.xpersona.co/agent/clawhub-mtsatryan-ah-data-scientist","protocols":["OPENCLEW"],"examples":[{"kind":"example","language":"python","snippet":"import pandas as pd\nimport numpy as np\nimport scipy.stats as stats\nfrom scipy.stats import ttest_ind, chi2_contingency, mannwhitneyu\nimport matplotlib.pyplot as plt\nimport seaborn as sns\nfrom sklearn.preprocessing import StandardScaler\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.metrics import classification_report, confusion_matrix\n\nclass StatisticalAnalyzer:\n    def __init__(self, data):\n        self.data = data\n        self.results = {}\n    \n    def descriptive_statistics(self, columns=None):\n        \"\"\"Generate comprehensive descriptive statistics\"\"\"\n        if columns is None:\n            columns = self.data.select_dtypes(include=[np.number]).columns\n        \n        stats_summary = {}\n        for col in columns:\n            stats_summary[col] = {\n                'count': self.data[col].count(),\n                'mean': self.data[col].mean(),\n                'median': self.data[col].median(),\n                'std': self.data[col].std(),\n                'min': self.data[col].min(),\n                'max': self.data[col].max(),\n                'q25': self.data[col].quantile(0.25),\n                'q75': self.data[col].quantile(0.75),\n                'skewness': stats.skew(self.data[col].dropna()),\n                'kurtosis': stats.kurtosis(self.data[col].dropna())\n            }\n        \n        return pd.DataFrame(stats_summary).T\n    \n    def hypothesis_testing(self, group_col, target_col, test_type='auto'):\n        \"\"\"Perform appropriate hypothesis tests\"\"\"\n        groups = self.data[group_col].unique()\n        \n        if len(groups) != 2:\n            raise ValueError(\"Currently supports only two-group comparisons\")\n        \n        group1 = self.data[self.data[group_col] == groups[0]][target_col].dropna()\n        group2 = self.data[self.data[group_col] == groups[1]][target_col].dropna()\n        \n        # Normality tests\n        _, p_norm1 = stats.shapiro(group1.sample(min(5000, len(group1))))\n        _, p_norm2 = stats.shapiro(group2.samp"},{"kind":"example","language":"python","snippet":"from sklearn.model_selection import cross_val_score, GridSearchCV, StratifiedKFold\nfrom sklearn.ensemble import RandomForestClassifier, GradientBoostingClassifier\nfrom sklearn.linear_model import LogisticRegression\nfrom sklearn.svm import SVC\nfrom sklearn.metrics import roc_auc_score, precision_recall_curve\nimport xgboost as xgb\nimport lightgbm as lgb\n\nclass MLPipeline:\n    def __init__(self, random_state=42):\n        self.random_state = random_state\n        self.models = {}\n        self.best_model = None\n        self.feature_importance = None\n    \n    def feature_engineering(self, X, y=None, numeric_features=None, categorical_features=None):\n        \"\"\"Advanced feature engineering\"\"\"\n        X_engineered = X.copy()\n        \n        # Numeric feature engineering\n        if numeric_features:\n            for col in numeric_features:\n                # Log transformation for skewed features\n                if X[col].skew() > 1:\n                    X_engineered[f'{col}_log'] = np.log1p(X[col])\n                \n                # Polynomial features for important variables\n                X_engineered[f'{col}_squared'] = X[col] ** 2\n                X_engineered[f'{col}_sqrt'] = np.sqrt(X[col])\n                \n                # Binning for non-linear relationships\n                X_engineered[f'{col}_binned'] = pd.cut(X[col], bins=5, labels=False)\n        \n        # Categorical feature engineering\n        if categorical_features:\n            for col in categorical_features:\n                # Target encoding (if y is provided)\n                if y is not None:\n                    target_mean = y.groupby(X[col]).mean()\n                    X_engineered[f'{col}_target_encoded'] = X[col].map(target_mean)\n                \n                # Frequency encoding\n                freq_map = X[col].value_counts(normalize=True)\n                X_engineered[f'{col}_frequency'] = X[col].map(freq_map)\n        \n        # Interaction features\n        if len(numeric_features) >= 2:\n          "}]}}