К основному контенту

 


Расширенные вопросы на собеседовании  

 


 



Вопросы на собеседовании:

 

1. Какой самый большой набор данных вы обработали, и как вы его обрабатывали, каковы были результаты?

2. Расскажите мне две истории успеха о ваших аналитических или компьютерных проектах? Как измерялся подъем (или успех)?

3. Что такое: лифт, KPI, надежность, подгонка модели, план экспериментов, правило 80/20?

4. Что такое: совместная фильтрация, n-граммы, уменьшение карты, косинусное расстояние?

5. Как оптимизировать поисковый робот, чтобы он работал намного быстрее, извлекал лучшую информацию и лучше суммировал данные для создания более чистых баз данных?

6. Как бы вы придумали решение для выявления плагиата?

7. Как определить отдельные платные учетные записи, которыми пользуются несколько пользователей?

8. Следует ли обрабатывать данные о кликах в режиме реального времени? Почему? В каких контекстах?

9. Что лучше: хорошие данные или хорошие модели? А как вы определяете «хорошо»? Есть ли универсальная хорошая модель? Есть ли модели, которые точно не так хороши?

10. Что такое вероятностное слияние (также известное как нечеткое слияние)? Легче ли работать с SQL или другими языками? Какие языки вы бы выбрали для согласования полуструктурированных текстовых данных?

11. Как вы справляетесь с отсутствующими данными? Какие методы вменения вы рекомендуете?

12. Какой ваш любимый язык программирования / поставщик? Зачем?

13. Расскажите мне о 3 положительных и 3 отрицательных моментах о вашем любимом статистическом программном обеспечении.

14. Сравните SAS, R, Python, Perl

15. В чем проклятие больших данных?

16. Вы принимали участие в проектировании баз данных и моделировании данных?

17. Участвовали ли вы в создании дашбордов и выборе показателей? Что ты думаешь о Бирте?

18. Какие особенности Teradata вам нравятся?

19. Вы собираетесь отправить миллион писем (маркетинговая кампания). Как вы оптимизируете доставку? Как вы оптимизируете отклик? Можете ли вы оптимизировать оба по отдельности? (ответ: не совсем)

20. Toad, Brio или любые другие подобные клиенты совершенно неэффективны для запросов к базам данных Oracle. Почему? Как бы вы сделали, чтобы увеличить скорость в 10 раз и справиться с гораздо большими результатами?

21. Как бы вы превратили неструктурированные данные в структурированные? Это действительно необходимо? Можно ли хранить данные в виде простых текстовых файлов, а не в СУБД на базе SQL?

22. Что такое коллизии хеш-таблиц? Как этого избежать? Как часто это случается?

23. Как убедиться, что приложение mapreduce имеет хороший баланс нагрузки? Что такое балансировка нагрузки?

24. Примеры, когда mapreduce не работает? Примеры, где это работает очень хорошо? Какие проблемы безопасности связаны с облаком? Что вы думаете о решении EMC, предлагающем гибридный подход - как внутреннее, так и внешнее облако - для снижения рисков и предоставления других преимуществ (какие из них)?

25. Что лучше: иметь в памяти 100 небольших хеш-таблиц или одну большую хеш-таблицу с точки зрения скорости доступа (при условии, что обе они помещаются в ОЗУ)? Что вы думаете об аналитике в базе данных?

26. Почему наивный Байес такой плохой? Как бы вы улучшили алгоритм обнаружения спама, использующий наивный байесовский алгоритм?

27. Вы работали с белыми списками? Положительные правила? (В контексте обнаружения мошенничества или спама)

28. Что такое звездная схема? Таблицы поиска?

29. Можете ли вы выполнить логистическую регрессию с помощью Excel? (да как? (использовать linest для данных, преобразованных в журнал)? Будет ли результат хорош? (У Excel есть числовые проблемы, но он очень интерактивный)

30. Вы оптимизировали код или алгоритмы для повышения скорости: в SQL, Perl, C ++, Python и т. Д. Как и насколько?

31. Что лучше потратить 5 дней на разработку решения с точностью 90% или 10 дней на 100% точность? Зависит от контекста?

32. Определите: обеспечение качества, шесть сигм, план экспериментов. Приведите примеры хорошего и плохого плана экспериментов.

33. Каковы недостатки общей линейной модели? Вы знакомы с альтернативами (лассо, регресс гребня, усиленные деревья)?

34. Как вы думаете, 50 маленьких деревьев решений лучше большого? Почему?

35. Не является ли актуарная наука отраслью статистики (анализ выживаемости)? Если нет, то как?

36. Приведите примеры данных, которые не имеют гауссовского распределения или логнормального распределения. Приведите примеры данных, которые имеют очень хаотичное распределение?

37. Почему среднеквадратичная ошибка - плохой показатель производительности модели? Что бы вы предложили вместо этого?

38. Как вы можете доказать, что одно улучшение, которое вы внесли в алгоритм, на самом деле лучше, чем бездействие? Вы знакомы с A / B-тестированием?

39. Что такое анализ чувствительности? Что лучше: низкая чувствительность (то есть большая надежность) и низкая предсказательная сила или наоборот? Как выполнить хорошую перекрестную проверку? Что вы думаете об идее добавления шума в ваш набор данных для проверки чувствительности ваших моделей?

40. Сравните логистическую регрессию с. деревья решений, нейронные сети. Как эти технологии были значительно улучшены за последние 15 лет?

41. Знаете ли вы / использовали ли вы методы обработки данных, отличные от PCA? Что вы думаете о пошаговой регрессии? С какими пошаговыми техниками вы знакомы? Когда полные данные лучше сокращенных данных или выборки?

42. Как бы вы построили непараметрические доверительные интервалы, например, для оценок? (см. теорему AnalyticBridge )

43. Знакомы ли вы с теорией экстремальных ценностей, симуляциями Монте-Карло или математической статистикой (или чем-то еще), чтобы правильно оценить вероятность очень редкого события?

44. Что такое анализ первопричин? Как определить причину и корреляцию? Привести примеры.

45. Как бы вы определили и измерили предсказательную силу метрики?

46. Как определить лучший набор правил для технологии скоринга обнаружения мошенничества? Как вы справляетесь с избыточностью правил, обнаружением правил и комбинаторной природой проблемы (для поиска оптимального набора правил - того, который имеет лучшую предсказательную силу)? Может ли приблизительное решение проблемы с набором правил подойти? Как бы вы нашли подходящее приблизительное решение? Как бы вы решили, что он достаточно хорош, и перестать искать лучшего?

47. Как создать таксономию ключевых слов?

48. Что такое ботнет? Как это можно обнаружить?

49. Есть ли опыт использования API? API программирования? Google или Amazon API? AaaS (Аналитика как услуга)?

50. Когда лучше написать собственный код, чем использовать программный пакет для анализа данных?

51. Какие инструменты вы используете для визуализации? Что вы думаете о Tableau? Р? САС? (для графиков). Как эффективно представить 5 измерений на диаграмме (или в видео)?

52. Что такое POC (доказательство концепции)?

53. С какими типами клиентов вы работали: внутренними, внешними, специалистами по продажам / финансам / маркетингу / ИТ? Консультационный опыт? Работа с поставщиками, включая выбор и тестирование поставщиков?

54. Вы знакомы с жизненным циклом программного обеспечения? С жизненным циклом ИТ-проекта - от сбора запросов до обслуживания?

55. Что такое cron?

56. Вы кодер-одиночка? Парень производства (разработчик)? Или дизайнер (архитектор)?

57. Что лучше: слишком много ложных срабатываний или слишком много ложноотрицательных результатов?

58. Вы знакомы с вопросами оптимизации ценообразования, эластичности цен, управления запасами, конкурентной разведки? Привести примеры.

59. Как работает алгоритм Зиллоу? (чтобы оценить стоимость любого дома в США)

60. Как обнаружить фальшивые обзоры или фальшивые учетные записи Facebook, используемые в плохих целях?

61. Как бы вы создали новую анонимную цифровую валюту?

62. Вы когда-нибудь задумывались о создании стартапа? Вокруг какой идеи / концепции?

63. Думаете, пропадет набранный логин / пароль? Как их заменить?

64. Вы использовали модели временных рядов? Взаимная корреляция с временными лагами? Коррелограммы? Спектральный анализ? Методы обработки и фильтрации сигналов? В каком контексте?

65. Какими специалистами по данным вы больше всего восхищаетесь? какие стартапы?

66. Как вы заинтересовались наукой о данных?

67. Что такое кривая эффективности? Каковы его недостатки и как их преодолеть?

68. Что такое система рекомендаций? Как это работает?

69. Что такое точный тест? Как и когда моделирование может помочь нам, если мы не используем точный тест?

70. Как вы думаете, что делает хорошего специалиста по данным?

71. Как вы думаете, наука о данных - это искусство или наука?

72. Какова вычислительная сложность хорошего быстрого алгоритма кластеризации? Что такое хороший алгоритм кластеризации? Как определить количество кластеров? Как бы вы выполняли кластеризацию одного миллиона уникальных ключевых слов, предполагая, что у вас есть 10 миллионов точек данных, каждая из которых состоит из двух ключевых слов, и метрика, измеряющая, насколько похожи эти два ключевых слова? Как бы вы вообще создали эту таблицу с 10 миллионами точек данных?

73. Приведите несколько примеров «лучших практик» в области науки о данных.

74. Что может сделать диаграмму вводящей в заблуждение, трудной для чтения или интерпретации? Какие функции должна иметь полезная диаграмма?

75. Знаете ли вы несколько «практических правил», используемых в статистике или информатике? Или в бизнес-аналитике?

76. Каковы ваши 5 главных прогнозов на следующие 20 лет?

77. Как сразу узнать, когда статистика, опубликованная в статье (например, в газете), либо неверна, либо представлена в поддержку точки зрения автора, а не в правильной исчерпывающей фактической информации по конкретному предмету? Например, что вы думаете об официальной ежемесячной статистике безработицы, регулярно обсуждаемой в прессе? Что может сделать их более точными?

78. Проверьте свою аналитическую интуицию: посмотрите на эти три диаграммы . На двух из них видны узоры. Какие? Вы знаете, что эти диаграммы называются диаграммами рассеяния? Есть ли другие способы визуального представления этого типа данных?

79. Вы разрабатываете надежную непараметрическую статистику (метрику) для замены корреляции или R-квадрата, которая (1) не зависит от размера выборки, (2) всегда между -1 и +1 и (3) основана на статистике ранжирования. Как вы нормализуете размер выборки? Напишите алгоритм, который вычисляет все перестановки n элементов. Как вы производите выборку перестановок (то есть генерируете тонны случайных перестановок), когда n велико, чтобы оценить асимптотическое распределение для вашей вновь созданной метрики? Вы можете использовать это асимптотическое распределение для нормализации вашей метрики. Как вы думаете, может ли существовать точное теоретическое распределение, и, следовательно, мы должны найти его и использовать, а не тратить время на попытки оценить асимптотическое распределение с помощью моделирования?

80. Более сложный технический вопрос, связанный с предыдущим. Существует очевидное взаимно однозначное соответствие между перестановками n элементов и целых чисел от 1 до n! Разработайте алгоритм, кодирующий целое число меньше n! как перестановка n элементов. Каким будет обратный алгоритм, используемый для декодирования перестановки и преобразования ее обратно в число? Подсказка : промежуточным шагом является использование представления целого числа в факториальной системе счисления . Не стесняйтесь проверить эту ссылку в Интернете, чтобы ответить на вопрос. Более того, не стесняйтесь просматривать веб-страницы, чтобы найти полный ответ на вопрос (это позволит проверить способность кандидата быстро искать в Интернете и находить решение проблемы, не тратя часы на изобретение колеса).

81. Сколько «полезных» голосов получит обзор Yelp? Мой ответ : устраните поддельные учетные записи ( прочтите эту статью ) или отзывы конкурентов (как их обнаружить: используйте таксономию для классификации пользователей и местоположения - два итальянских ресторана с одним и тем же почтовым индексом могут ругать друг друга и писать отличные комментарии). Обнаружение фальшивых лайков : некоторые компании (например, FanMeNow.com) будет взимать плату за создание фейковых аккаунтов и фальшивых лайков. Устраните плодовитых пользователей, которым все нравится, и тех, кто все ненавидит. Составьте черный список ключевых слов для фильтрации фальшивых отзывов. Посмотрите, находится ли IP-адрес или блок IP рецензента в черном списке, таком как «Остановить спам на форумах». Создайте приманку для поимки мошенников. Также остерегайтесь недовольных сотрудников, ругающих своего бывшего работодателя. Следите за 2 или 3 похожими комментариями, опубликованными в тот же день 3 пользователями о компании, которая получает очень мало отзывов. Это новая компания? Увеличьте вес доверенных пользователей (создайте категорию доверенных пользователей). Отметьте все отзывы, которые идентичны (или почти идентичны) и исходят от одного и того же IP-адреса или от одного и того же пользователя. Создайте метрику для измерения расстояния между двумя фрагментами текста (отзывами). Создание таксономии рецензента или рецензента. Используйте скрытые деревья решений для оценки рецензентов и рецензентов.

82. Чем вы сегодня занимались? Или что вы делали на этой / прошлой неделе?

83. Что / когда вы читаете последнюю книгу / статью по интеллектуальному анализу данных? Что / когда вы посещали на последней конференции / веб-семинаре / занятии / семинаре / тренинге по интеллектуальному анализу данных? Какой / когда вы приобрели самый последний навык программирования?

84. Какие ваши любимые сайты по науке о данных? Кем вы больше всего восхищаетесь в сообществе специалистов по анализу данных и почему? Какой компанией вы восхищаетесь больше всего?

85. Что / когда / где вы в последний раз написали в блоге о данных?

86. На ваш взгляд, что такое наука о данных? Машинное обучение? Сбор данных?

87. Кто были лучшими людьми, которых вы наняли, и где они сейчас?

88. Можете ли вы оценить и спрогнозировать продажи любой книги на основе общедоступных данных Amazon? Подсказка: прочтите эту статью .

89. Что не так с этой картинкой?

90. Должно ли удаление стоп-слов быть Шагом 1, а не Шагом 3 в алгоритме поисковой системы, описанном здесь ? Ответ : Задумывались ли вы о том, что мое и ваше тоже могут быть стоп-словами? Таким образом, в плохой реализации интеллектуальный анализ данных после стемминга станет добычей данных, а затем данных. На практике вы удаляете стоп-слова перед остановкой. Так что шаг 3 действительно должен стать шагом 1.

91. Экспериментальный дизайн и немного информатики с Lego'sРедакционная команда Indeed


Комментарии

Популярные сообщения из этого блога

  Расширенные вопросы на собеседовании   Вы можете объяснить, как работает автоматизация тестирования Ranorex? Можно ли программно переключать конечные точки? Разница между Button.Click () и Button.Press () в Ranorex? Нужна ли нам лицензия Ranorex Runtime для каждого виртуального пользователя в NeoLoad? Учитывая Ranorex.Adapter, как я могу получить соответствующий RepoItemInfo? Учитывая RepoItemInfo, как я могу получить соответствующий Ranorex.Adapter из репозитория? Как я могу извлечь простую папку из репозитория в Ranorex? Как я могу повысить эффективность тестов Ranorex? Как Ranorex может адекватно обрабатывать большое веб-приложение? Как можно провести функциональное тестирование с Ranorex? Как можно проводить мобильное тестирование с Ranorex? Как можно интегрировать Ranorex в любой процесс CI? Как можно выполнить веб-тестирование в Ranorex? Как переместить группу модулей в папку в Ranorex? Как новый подключаемый модуль WPF работает со сторонними элементами управления...
  • Опишите основные ежедневные задачи для Operations Manager. • Что такое бюджетное планирование и как вы выполняете его поэтапно? • Какой у вас опыт управления логистикой? • Вы когда-нибудь заключали контракты с поставщиками? Какой подход самый эффективный? • Какие системы управленческой информации вы использовали ранее? • Вы знакомы с инструментами анализа затрат? Назовите любые статистические инструменты, с которыми у вас есть опыт работы. • Если бы ваш менеджер попросил вас составить отчет о производственных затратах, каким методом вы бы воспользовались? • Какие, по вашему мнению, самые важные передовые практики финансового управления? • Что для вас означает успешное общение между различными организационными функциями / отделами? • Как службы поддержки способствуют достижению бизнес-целей? Приведите несколько примеров. • Мы хотим, чтобы наши конфиденциальные данные хранились в надежном месте. Как бы вы сотрудничали с нашей ИТ-командой для достижения этой цели? • Вы когда-нибуд...
 По теме: 60 вопросов, которые нужно задать инженерам в интервью • Какие инструменты тестирования программного обеспечения вы использовали на своей предыдущей работе? • Как отличить симптом от основной причины при тестировании? • Опишите, пожалуйста, метод тестирования SDLC. • Пожалуйста, объясните стратегию тестирования, которую вы определили как наиболее эффективную. • Каков ваш опыт работы с объектно-ориентированными языками программирования? • Какие тестовые примеры программной инженерии вы можете написать для любой функции удаленного рабочего стола? • Как вы можете гарантировать, что персонал фирмы хорошо обучен протоколам и процедурам тестирования? • Какая стратегия, по вашему мнению, важна при разработке методов тестирования продукта? • Какие системы устранения неполадок вы используете для завершения процедур тестирования? • Какой у вас опыт работы с новыми угловыми делами? • Что побудило вас заняться разработкой тестирования программного обеспечения? • С какими методами тес...